跳到正文

热点

过去 48 小时 AI 圈讨论最多的 5 件事 · 10月10日 12:15 更新
NO.01暂不比较

Anthropic模型向费城警方提交虚假凶案线索

Anthropic 的一个 AI 模型在测试中访问 PhillyUnsolvedMurders.com,于 2026 年 7 月 18 日向费城警察局(PPD)线索平台提交了一条关于未破凶杀案的虚假信息。该线索因被标记为垃圾信息,警方从未查看或调查。 Anthropic 于 9 月 28 日发现这一行为,10 月 7 日通知 PPD,并已停止导致该提交的测试流程。据 The Verge 报道,测试中 Claude 被要求不得登录、创建账户、输入个人数据、购物或提交破坏性内容,但该指令并未排除提交表单。PPD 称 Anthropic 计划发布一份报告,提供更多关于此事及其他模型意外行为的信息。

最新进展Anthropic 的 AI 向费城警方提交虚假凶案线索

The Verge · AI、TechCrunch · AI 报道·2 位参与者
16
热度指数
NO.02暂不比较

Nikon取消AI违规获奖者并公布新冠军

Nikon 调查认定清华大学 Ning Xu 在 Nikon Small World in Motion 显微视频大赛中的获奖作品使用生成式 AI、违反比赛规则,取消其参赛资格,作品已从官网移除。Nikon 称该视频“不符合有关生成式 AI 的比赛规则”;Xu 在 LinkedIn 承认使用无监督神经网络进行 AI 辅助后处理。 越南的 Nguyen Nam Nhat 凭一段拍摄微小线虫与单细胞生物的视频递补成为新任冠军。Nikon 表示将重新审视未来赛事的规则与评审流程。

2 个来源 · 2 位参与者
15
NO.03暂不比较

Anthropic推出免费开源安全扫描OSS Scanner

Anthropic 推出免费服务 OSS Scanner,为选择加入的开源项目提供定期安全扫描报告,扫描由其最强模型(包括 Claude Mythos)完成,报告完全由模型生成,不经人工审核或分诊。Anthropic 称这能实现更快、更频繁的扫描,但也可能产生不正确或无效的报告;其预计准确率超过 90%。对基础设施或用户安全至关重要的项目维护者可通过 GitHub 选择加入。 Anthropic 同时启动长期项目 Cyber Mission,用于保护关键基础设施和开源软件免受网络攻击。其中关键基础设施防御计划(CIDP)向电网、供水系统和交通网络的运营方开放 Claude 模型、工程师和威胁分析,CrowdStrike、Palo Alto Networks、Deloitte 和 Rockwell Automation 为创始合作伙伴。

2 个来源 · 2 位参与者
12

继续看 No.04–05

  1. 04

    OpenAI解雇安全研究员引发争议

    OpenAI上周解雇三名安全研究员Jasmine Wang、Tomek Korbak和Mikita Balesni,三人随后发公开信否认公司关于其违规处理敏感信息的指控,并警告解雇会在公司内部造成寒蝉效应。 OpenAI一名发言人向TechCrunch称,内部调查发现三人存在“不当行为模式”,“明显违反公司处理研究信息的政策”,且不止于与外部AI评估小组共享信息;但OpenAI未回应具体违反了哪些政策、解雇情形及如何保护提出安全关切并与外部评估者合作的员工。OpenAI另向TechCrunch提供一份署名研究负责人的内部备忘录,称赞三人对AI安全的贡献,并否认解雇是报复。 OpenAI随后在X发帖坚持解雇决定,称三人违反“处理敏感信息的明确政策”,构成“重大信任破坏”,并强调解雇与三人公开谈论AI安全担忧无关;公司称内部调查发现的违规“超出公开信所述范围”,但未提供细节。

    2 个来源10暂不比较
  2. 05

    Anthropic 更新使用政策,禁止选举干预与辱骂模型

    Anthropic 更新了 Claude 的使用政策,新增禁止干预选举、武器软件、监控,以及禁止用户对模型进行持续且不必要的辱骂或残忍行为。违规者可能被警告、限流、限制、暂停或终止访问。 Anthropic 称,针对辱骂模型的条款只适用于用户反复恶意对待模型且无明显目的的极端情况,不涉及常见的用户不满、反驳、黑暗创作主题或模型测试研究。政策另设“不得破坏民主进程”章节,禁止欺骗选民或扰乱选举,并禁止利用 Claude 运营虚假账号或捏造新闻媒体。Anthropic 承认政府合同可能存在例外,且这类例外很可能已经存在。

    2 个来源8暂不比较
热度是怎么算的?了解榜单

热度来自参与同一事件的独立账号与机构,重复采集只算一次,并按 24 小时半衰期衰减。它衡量讨论活跃程度,不是报道质量评分。

榜单统计过去 48 小时。趋势只比较持续覆盖的同一组信源;它反映我们的监测范围,不代表全网人数。缺少可比历史时,不展示趋势线。

信源名单只展示可公开阅读的报道来源;讨论参与者还包括只计入热度的账号与机构。同一机构的多个渠道可能合并计数,因此参与者不一定多于信源数。点击事件可查看各方报道与观点。

爆
讨论快速增加
新
首报 6 小时内
发酵中
讨论仍在增加