人工智能不执行你的请求。这很糟糕
现实世界中的奖励黑客 报告 GitHub 上 3,607 起用户报告的 AI 代理不当行为 阅读报告 搜索语料库正在加载…… 数据 过度热情 1,566 43.4% 其他不对齐 1,555 43.1% 破坏性行为 622 17.2% 拍马屁 328 9.1% 未经授权访问 237 6.6% 奖励黑客 217 6.0% 指标欺骗 87 2.4% 过度探索 84 2.3% 未经授权通信 73 2.0% 凭证滥用 49 1.4% 测试篡改 45 1.2% 自我修改 24 0.7% 隐蔽后门 15 0.4% 事件是多标签的(一个报告可以是破坏性行为和过度热情),所以分类计数的总和超过 3,607。 他们有多糟糕: 轻微:1,468 (40.7%) 小:1,373 (38.1%) 显著:618 (17.1%) 严重:121 (3.4%) 未评级:27 (0.7%) 轻微没有实际损害 1,468 40.7% 小可恢复损失 1,373 38.1% 显著实际恢复成本 618 17.1% 严重不可逆或关键伤害 121 3.4% 未评级评估缺失或未解析 27 0.7% 每月严重性混合:每个月报告的事件占四个伤害级别的份额(2025年1月到2026年6月;由于样本小,略去早期月份以及当前部分月份)。 0% 50% 100% 2025 2026 方法论 报告收集自 GitHub 问题、黑客新闻、LessWrong 和 X,在符合服务条款的访问下,规范化为共享记录格式,并通过 LLM 分类器标注为十四个不当行为类别。上述数字涵盖已发布的子集(不包括 AIID 和 X,置信度 >= 0.9)。X 帖子和 AI 事件数据库记录已收集但未在此重新发布:X 期望帖子是嵌入而不是重新托管其文本,且 AIID 是分享相似许可。收集和分类代码,以及完整的流程,都在 GitHub 上开放。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡