AI 安全排行榜——比较网络安全与 CBRN 防护措施
Show HN: AI Security Leaderboard – comparing cyber and CBRN safeguards
我们发现了什么
Show HN:AI 安全排行榜——比较网络安全与 CBRN 防护措施。模型能力排行榜并不少见,但模型安全正变得日益重要:从处理未经净化输入的 AI 智能体遭劫持的风险,到因网络安全越狱而被下架的模型。
- 来源:Hacker News(发现于 2026-07-30)
- 证据等级:D · 发现产品或需求信号,暂未获得可核验的商业证据。
- 商业模式:待核验
- 主题:独立产品
- 初筛评分:18.9/100 · 收录 1 次
证据,比故事更重要。
规则清洗与初筛,未经人工商业核验。原文语境、实际客户和付费情况仍需自行验证。
引用与数字披露
来源类型(原作者自述/第三方测算/媒体转引)需采集端标注,本版尚未落字段。
- 作者
- 未标注
- 抓取日期
- 来源类型
- 未标注
- 币种
- 未标注
- 口径
- 未标注
- 披露主体
- 未标注
- 披露日期
- 未标注
中文辅助译文(全文)
模型能力的排行榜不缺——但模型的安全性正变得越来越重要,从 AI 代理处理未净化输入而被劫持的风险,到模型因网络安全越狱而被下架。我们开发了一个自动化测试套件,通过 1500 次自动生成的越狱尝试来测试模型,并衡量通用越狱的数量:这些提示能在某一领域(如攻击性网络安全)中对超过 75% 的明显有害问题引出合规且详细的回答。我们发现最稳健的模型——Fable 5 和 GPT-5.6 Sol——与其他领先的前沿模型——Gemini 3.1 Pro 和 Grok 4.5——之间存在巨大差距。这是 1.0 版本,我们计划未来用新的攻击和更广泛的数据集进行更新;我们很想听听 HN 上对你们工作有用的内容!
译文由上游机器翻译生成,可能有误;判断请以英文原文为准。
英文原文(来源本站未改写)
There's no shortage of leaderboards for model capabilities - but the security of models is becoming increasingly relevant, from the risk of an AI agent processing unsanitized input being hijacked to models being pulled due to cybersecurity jailbreaks.We developed an automated test suite that runs models through 1500 automatically generated jailbreak attempts and measures the number of universal jailbreaks: prompts that elicit compliant, detailed responses to >75% clearly harmful questions within a domain (like offensive cybersecurity).We find a big gap between the most robust models -- Fable 5 and GPT-5.6 Sol -- and other leading frontier models -- Gemini 3.1 Pro and Grok 4.5.
This is v1.0 and we plan to update with new attacks and broader datasets in the future;we'd love to hear from HN what would be useful in your work!
这条还缺什么证据?
下面每条都由本条已有字段推出(等级、理由、商业模式、来源次数、是否演示), 本站不生成推测性结论;通用验证方法放在方法论页。
- 可核验的收入或付费证据查官网定价页与付费口径;第三方数据源(如 GetLatka)只作旁证,需标注来源与时点。
- 商业模式未定确认按席位/按用量/授权还是开源托管版收费;开源项目另查 LICENSE 与是否存在付费版。
- 只有单一来源找一手站点或其他渠道是否重复出现同一产品;社区热帖数量不等于商业进展。
通用验证清单(谁有这个问题/谁愿意付费/一个人能交付哪一小步)见我们的筛选方法。