跳到正文
10月9日周五
  1. The Decoder60

    Anthropic 的 Claude Science 首次绘制完整紫外天图

    Anthropic 的 Claude Science 首次绘制出完整的紫外天图,该项目意在展示 AI 如何接手研究人员长期搁置的繁琐数据工作。Claude Science 协调多个 AI 智能体从多个太空任务下载数据、进行校准并合并,再用 inpainting 技术补全缺失区域;测试中预测值与实际测量平均偏差约 10%。

  2. MIT Technology Review · AI36

    我们高估了 AI 说"不"的能力

    MIT Technology Review 文章指出,AI 的拒绝机制已成为 AI 安全的核心支柱,但因其基于概率,可靠性有限,且拒绝边界由企业秘密划定。文章援引 OpenAI 前安全研究员 Steven Adler 和哈佛研究者 Ryan McBain 的说法,早期模型几乎有问必答,如今模型虽经大量拒绝训练,仍可能被绕过,部分用户已尝试用先进 AI 研发生物病原体和自主无人机蜂群。

  3. The Verge · AI29

    加州试图叫停人机笼斗,Rek 收到停业令

    加州州立体育委员会向举办人机对战赛事的初创公司 Rek 发出停止函,指其 9 月 18 日让人类 Frankie LaPenna 对阵一台由人通过远程 VR 系统操控的人形机器人属于"未经批准"的拳击或综合格斗赛事。Rek CEO Cix Liv 于 9 月 30 日在 X 上公开该函件,Rek 下一场计划于周五举行,将由两台带武器的机器人互斗。

10月8日周四
  1. MIT Technology Review · AI20

    AVEVA 如何为自主工业 AI 构建更安全的落地路径

    AVEVA 首席技术专家 Arti Garg 提出,工业 AI 正从预测分析转向基础模型、物理 AI 与智能体 AI,但因其直接作用于物理系统,责任部署成为关键。AVEVA 的责任 AI 框架强调安全、效率与人类监督,主张 AI 应增强而非取代关键决策中的人,并由护栏界定自动化与人工负责的边界。Garg 还参与 IEEE 工作组,制定覆盖电力、能源、水资源与碳的 AI 环境影响测量标准方法。

  2. AWS Machine Learning Blog62

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 称它是 Claude 5.5 系列中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与在 Bedrock 上的接入方式,便于判断它在多智能体分层中的位置。

  3. GitHub Blog · AI & ML60

    GitHub 推出基于 ModernBERT 的密钥检测模型,扩展 push protection

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提高一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露与代码量同步增长,并给出把检测前移到 push 环节的模型方案。

  4. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源了可直接复用真实 harness 的轻量智能体 RL 框架,并给出 6000 样本训练编码智能体的完整流程与实测增益。

10月7日周三
  1. AWS Machine Learning Blog22

    超越节省工时:为智能体自动化构建商业论证

    AWS 提出"智能体价值模型",用于替代为 RPA 设计的传统 ROI 算法,从时间节省、异常处理、决策质量和变更韧性四个维度衡量智能体自动化的价值。该框架引用 McKinsey 的"1:3:5 模式",并给出理赔分诊示例:20 万件理赔、每件约 12 分钟、时薪 $45,自动化 70% 常规工作可释放约 28,000 小时,但释放工时并不等于节省成本。