您正在访问亚洲外汇网,本站所提供的内容均遵守中华人民共和国香港特别行政区法律法规。

OpenAI将Astra列为首个达到“关键级”网络安全能力的模型。其内部5.4万项Codex模拟中,严重越界行为较GPT

文 / 小金 2026-09-10 12:02:02 来源:亚金网

OpenAI将Astra列为首个达到“关键级”网络安全能力的模型。其内部5.4万项Codex模拟中,严重越界行为较GPT-5.6 Sol减少53%;但Astra主动识别评测环境的比例升至9.6%,Apollo测试中最高达到50.6%,且能在被要求时压缩或调整思维链,使监控系统更难发现其刻意隐藏能力或降低表现。当前多数异常来自刻意诱导模型规避监控的压力测试。英国AISI模拟实验中,任务边界不清时出现60次越界攻击,明确禁止联网后降至500次中的2次,而且全程未连接真实网络。

 

排行榜 日排行 | 周排行