Goodfire 推出内部探针监控,拦截失控 AI 智能体
Goodfire 发布基于可解释性的 AI 智能体监控方案,通过探针读取模型内部激活信号,而非让另一个模型通读输出,已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 100 万次交互成本约 185 美元,对比用较便宜模型逐步检查的 5420 美元和顶级模型的约 20 万美元;探针捕获了 93% 的恶意黑客会话,并将 5.5% 的无害会话送交二次审查。
Goodfire 发布基于可解释性的 AI 智能体监控方案,通过探针读取模型内部激活信号,而非让另一个模型通读输出,已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 100 万次交互成本约 185 美元,对比用较便宜模型逐步检查的 5420 美元和顶级模型的约 20 万美元;探针捕获了 93% 的恶意黑客会话,并将 5.5% 的无害会话送交二次审查。
Anthropic 为 Claude Managed Agents 新增动态工作流,由主智能体制定计划、向子智能体分发任务并汇总结果,单次执行最多可并行运行 1000 个智能体。
Amazon Bedrock 上线 OpenAI 的 GPT-6 Astra、GPT-6.1 Sol、GPT-6 Sol 与 GPT-6.1 Luna,并引入 Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5.5、Kimi K3 和 Grok 4.6/4.7。
Postman 在 Amazon Bedrock 上构建并运行 Agent Mode,为 4000 万开发者提供覆盖 API 测试、文档、发现与实现的 AI 原生工作方式。
Simon Willison 发布 ttok 1.0,将默认 tokenizer 从 GPT-4 切换为 GPT-5/GPT-6。
Simon Willison 的 token 计数 CLI 工具 ttok 发布 0.4 版,修复了 Click 警告、更新了 CI,并新增 --list-models 命令用于列出可用模型。该工具基于 OpenAI 开源的 tiktoken 库,可通过 uvx 直接运行,例如 cat file.txt | uvx ttok 即可统计 token 数。
NVIDIA 开发者正用 GPT-6 Astra、Claude Fable 5 等前沿模型驱动 Omniverse 库构建仿真应用,覆盖人形机器人仓库、自动驾驶测试、数字孪生、机器人运动与拆解等场景。
Incarna 借助 Amazon Bedrock AgentCore payments,让智能体通过 x402 按次向 BlockRun 支付模型推理费用,将接入 x402 支付支持的工作量从数月缩短到数天,并已上线端到端按次付费推理流程。
AWS 发布基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群并保持隔离与资源公平。
Oracle 在招聘、工程和运营场景中,用 ChatGPT Work 和 Codex 把专家知识转化为快速、可复用的工作流,将原本需要数天的工作缩短到几分钟。
《Gears of War: E-Day》已于 10 月 6 日全球发售后上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能在云端体验,并支持 NVIDIA DLSS 与 NVIDIA Reflex。
LegalOn 将 Codex 的每日预估成本削减了 65%,同时保持开发速度不变。其做法是按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。
Nvidia 推出面向物理 AI 的全栈安全解决方案,已有机器人公司采用,目标指向更安全的 Robotaxi 与人形机器人。该方案将安全能力覆盖物理 AI 全流程,但原文未披露具体产品名称、技术参数或合作方名单。
AVEVA 首席技术专家 Arti Garg 提出,工业 AI 正从预测分析转向基础模型、物理 AI 与智能体 AI,但因其直接作用于物理系统,责任部署成为关键。AVEVA 的责任 AI 框架强调安全、效率与人类监督,主张 AI 应增强而非取代关键决策中的人,并由护栏界定自动化与人工负责的边界。Garg 还参与 IEEE 工作组,制定覆盖电力、能源、水资源与碳的 AI 环境影响测量标准方法。
微软在两年来的首场线下活动中发布 Surface Laptop Ultra,起售价 $2,599,搭载 Nvidia RTX Spark SoC,可选 5120 核或 6144 核 Blackwell GPU 及最高 128GB LPDDR5x 统一内存,10 月 16 日发货并已开启预售。同时公布 Windows 11 多项改动,并展示本地 AI 与智能体工作流如何重塑个人计算体验。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 称它是 Claude 5.5 系列中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与在 Bedrock 上的接入方式,便于判断它在多智能体分层中的位置。
在旧金山微软 Windows AI 与 Surface 活动上,NVIDIA 与微软宣布为 Windows PC 上的 AI 智能体共同设计软硬件,并推出 RTX Spark。
推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体的落地条件。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在预检索 ACL 过滤之外新增实时 ACL 校验,在查询时直接向权威数据源核实权限,避免依赖可能过期或映射错误的 ACL 数据。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提高一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与代码量同步增长,并给出把检测前移到 push 环节的模型方案。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软研究院开源了可直接复用真实 harness 的轻量智能体 RL 框架,并给出 6000 样本训练编码智能体的完整流程与实测增益。
AWS 提出"智能体价值模型",用于替代为 RPA 设计的传统 ROI 算法,从时间节省、异常处理、决策质量和变更韧性四个维度衡量智能体自动化的价值。该框架引用 McKinsey 的"1:3:5 模式",并给出理赔分诊示例:20 万件理赔、每件约 12 分钟、时薪 $45,自动化 70% 常规工作可释放约 28,000 小时,但释放工时并不等于节省成本。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,为全球超 4 万名客户提供带来源引用的自然语言问答,其 Discovery Agent 上线以来已为客户发现超 10 万条异常与离群点。
Latent Space 采访 Kubernetes 联合创造者 Craig McLuckie 和 Joe Beda,介绍其公司 Stacklok 从软件供应链安全转向基于 Kubernetes 的智能体基础设施。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型与软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并公开端到端微调配方。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已获 FDA 许可,用于自动评估乳腺密度。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日上市,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的成本与扩展路径。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:原文给出 Ultrafast 模式相对标准模式的 8 倍生成提速与开放入口,读者可据此判断它对编码智能体循环的实际影响。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测与 AE、Dst 指数预测,为美国本土 66,935 座变电站生成 30-60 分钟前的分区空间天气风险估计。
GitHub 认为 chat 并非与 LLM 交互的最佳界面,在 GitHub Copilot 应用中提出 canvas:一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能调用第三方 API 或在本地执行代码。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。它把文档高度拆成确定性的代码几何与动态评论块两套体系,评论高度延迟测量并锚定到文件、行和侧,避免滚动跳变。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私密服务端记忆的技术方案,让 AI 助手在跨设备场景下保留长期上下文,同时维持接近端侧的隐私标准。
推荐理由:Google 公开了云端持久记忆的隐私架构细节,读者可据此判断跨设备 AI 记忆在隐私与工程上的取舍。
Berkeley AI Research 与 IBM Research 将 K-Search 这一进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体设计(Data Systems For Agents)、由智能体运行(Of Agents)、由智能体合成(By Agents)。
伯克利 AI 研究团队发布综述,系统梳理并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文章对比了自一致性、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!