跳到正文
TechCrunch · AI· Aditya Mehta·· 2 天前精选

Goodfire 推出内部激活监控,拦截失控 AI 智能体成本大幅降低

Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost

AI 导读

Goodfire 发布面向 AI 智能体的监控方案,通过读取模型内部激活信号而非重新审阅输出,来发现失控行为,该方案已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 100 万次交互成本约 185 美元,而用较便宜的 AI 模型逐步检查需 5420 美元、顶级模型约 20 万美元;探针捕获了 93% 的恶意黑客会话,并将 5.5% 的无害会话送交二次审查。

推荐理由

介绍了一种在模型内部激活层做监控的智能体安全方案,并给出成本与检出率数据,便于比较现有监控路线。

来源:TechCrunch · AI · techcrunch.com