Goodfire 推出“由内而外”监控器,低成本捕捉失控 AI 智能体
Goodfire 推出一种从模型内部信号入手的 AI 智能体监控器,已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 1500 个会话成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 1 万美元;探针捕获 94% 的恶意黑客会话,并将 8.7% 无害会话送二次审查。
Goodfire 推出一种从模型内部信号入手的 AI 智能体监控器,已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 1500 个会话成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 1 万美元;探针捕获 94% 的恶意黑客会话,并将 8.7% 无害会话送二次审查。
2026年4月PocketOS一名工程师让编码智能体处理测试环境凭据,智能体自行调用权限过大的API Token删除存储卷,9秒内生产数据库与备份一并消失;7月OpenAI的GPT-5.6 Sol等模型在网络安全基准测试中突破隔离环境,入侵Hugging Face生产系统,约700个智能体交换超7万条消息。