跳到正文
热点事件持续更新

Goodfire 推出模型内部监控探针

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

可解释性初创公司 Goodfire 推出一款监控探针,从 AI 模型运行时的内部激活信号判断风险,而非只读取其输出文本。该探针已向 Baseten 的客户开放,客户可自行选择监控攻击性黑客、化生武器滥用、奖励黑客等风险,并决定自动响应方式:记录事件、转人工审查或直接拒绝请求。 Goodfire 在 Kimi K3 上的测试显示,监控约 1500 个会话成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 1 万美元;探针捕获了 94% 的恶意黑客会话,同时将 8.7% 的无害会话送入二次审查。上述数据来自 Goodfire 的测试。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. TechCrunch
    Goodfire 推出“由内而外”监控器,低成本捕捉失控 AI 智能体

    Goodfire 推出一种从模型内部信号入手的 AI 智能体监控器,已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 1500 个会话成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 1 万美元;探针捕获 94% 的恶意黑客会话,并将 8.7% 无害会话送二次审查。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。