跳到正文
今天10月10日周六9 条
  1. TechCrunch · AI62

    Goodfire 推出内部探针监控,拦截失控 AI 智能体

    Goodfire 发布基于可解释性的 AI 智能体监控方案,通过探针读取模型内部激活信号,而非让另一个模型通读输出,已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 100 万次交互成本约 185 美元,对比用较便宜模型逐步检查的 5420 美元和顶级模型的约 20 万美元;探针捕获了 93% 的恶意黑客会话,并将 5.5% 的无害会话送交二次审查。

  2. TechCrunch · AI55

    Natura 推出 99 美元智能戒指 Interface,把 AI 智能体戴在手指上

    AI 与硬件初创公司 Natura 发布 99 美元智能戒指 Interface,按下手指即可让 AI 智能体完成任务、记录想法,无需掏出手机。该戒指同时是健康追踪设备,可监测心率、HRV、睡眠和活动,并支持 Meta 的 Muse、Instinct、Grok Bot、Claude、ChatGPT 等智能体和应用,用户可指定不同智能体处理不同任务。

  3. TechCrunch · AI36

    Amazon 与微软相继放弃数据中心交易保密协议,能重建社区信任吗?

    Amazon 宣布在与地方政府谈判数据中心交易时不再使用保密协议(NDA),此前微软今年早些时候已采取类似行动。保密做法此前引发社区对 AI 基础设施的强烈反对,从纽约到旧金山已有数百项拟议或已生效的暂停令。TechCrunch Equity 播客本期还讨论了个人 AI 初创公司为何把信任当作真正的产品。

  4. TechCrunch · AI22

    Amazon 放弃数据中心保密协议,AI 智能体想要你的信用卡

    Amazon 宣布在与地方政府谈判数据中心交易时将停止使用 NDA,此前 Microsoft 今年早些时候已采取类似举措。保密做法引发的社区反对已导致从纽约到旧金山数百项拟议和已实施的禁令。与此同时,一批初创公司押注消费者愿意让 AI 智能体访问自己的收件箱、文件和信用卡,前提是能让网站放行。

10月9日周五
  1. The Decoder60

    Anthropic 的 Claude Science 首次绘制完整紫外天图

    Anthropic 的 Claude Science 首次绘制出完整的紫外天图,该项目意在展示 AI 如何接手研究人员长期搁置的繁琐数据工作。Claude Science 协调多个 AI 智能体从多个太空任务下载数据、进行校准并合并,再用 inpainting 技术补全缺失区域;测试中预测值与实际测量平均偏差约 10%。

10月8日周四
  1. AWS Machine Learning Blog62

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 称它是 Claude 5.5 系列中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与在 Bedrock 上的接入方式,便于判断它在多智能体分层中的位置。

  2. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源了可直接复用真实 harness 的轻量智能体 RL 框架,并给出 6000 样本训练编码智能体的完整流程与实测增益。

10月7日周三
  1. AWS Machine Learning Blog22

    超越节省工时:为智能体自动化构建商业论证

    AWS 提出"智能体价值模型",用于替代为 RPA 设计的传统 ROI 算法,从时间节省、异常处理、决策质量和变更韧性四个维度衡量智能体自动化的价值。该框架引用 McKinsey 的"1:3:5 模式",并给出理赔分诊示例:20 万件理赔、每件约 12 分钟、时薪 $45,自动化 70% 常规工作可释放约 28,000 小时,但释放工时并不等于节省成本。

10月6日周二
  1. Latent Space76

    Reflection 发布 Beam:501B-A23B 美国开源 MoE 模型

    Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 协议在本月放出。

    推荐理由:Reflection 首次发布开源权重模型 Beam,给出训练规模、评测成绩与算力投入,可对照同期中美开源模型的位置。

10月5日周一
  1. MIT Technology Review · AI12

    从预测到自主决策:预测分析如何迈入智能体 AI 时代

    企业 AI 的竞争前沿已从预测精度转向自主决策,核心挑战是让预测系统在自主行动时不偏离业务意图。深度学习和生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而无需等待季度刷新,其数据来源也从结构化数值扩展到非结构化交互数据。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正让位于 AI。

10月3日周六
10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作,GitHub 给出三项需要强化的技能

    GitHub 提出 AI 时代开发者需要强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 省下的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。

9月26日周六
  1. GitHub Blog · AI & ML38

    GitHub Copilot 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等工具,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 上分享现成模板。

9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,并公开了完整实现与运行方式。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:该不该读 AI 代码、RAG 是否已死、Skills 是否取代 MCP

    GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,二者可组合使用。RAG 并未消亡,它通过检索外部知识减少 token 消耗并让回答更有依据,可与 Agent、Skills、MCP 共存于同一工作流。

9月16日周三