Goodfire 推出模型内部监控探针
热点事件持续更新
Goodfire 推出模型内部监控探针
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
可解释性初创公司 Goodfire 推出一款监控探针,从 AI 模型运行时的内部激活信号判断风险,而非只读取其输出文本。该探针已向 Baseten 的客户开放,客户可自行选择监控攻击性黑客、化生武器滥用、奖励黑客等风险,并决定自动响应方式:记录事件、转人工审查或直接拒绝请求。 Goodfire 在 Kimi K3 上的测试显示,监控约 1500 个会话成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 1 万美元;探针捕获了 94% 的恶意黑客会话,同时将 8.7% 的无害会话送入二次审查。上述数据来自 Goodfire 的测试。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 00:00
Goodfire 推出“由内而外”监控器,低成本捕捉失控 AI 智能体报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- TechCrunchGoodfire 推出“由内而外”监控器,低成本捕捉失控 AI 智能体
Goodfire 推出一种从模型内部信号入手的 AI 智能体监控器,已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 1500 个会话成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 1 万美元;探针捕获 94% 的恶意黑客会话,并将 8.7% 无害会话送二次审查。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。