跳到正文
  1. AWS Machine Learning Blog62

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 称它是 Claude 5.5 系列中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与在 Bedrock 上的接入方式,便于判断它在多智能体分层中的位置。

  2. NVIDIA Blog76

    NVIDIA 与微软发布 RTX Spark 及 Windows 智能体基础设施

    在旧金山微软 Windows AI 与 Surface 活动上,NVIDIA 与微软宣布为 Windows PC 上的 AI 智能体共同设计软硬件,并推出 RTX Spark。

    推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体的落地条件。

  3. GitHub Blog · AI & ML60

    GitHub 推出基于 ModernBERT 的密钥检测模型,扩展 push protection

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提高一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露与代码量同步增长,并给出把检测前移到 push 环节的模型方案。

  4. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源了可直接复用真实 harness 的轻量智能体 RL 框架,并给出 6000 样本训练编码智能体的完整流程与实测增益。

  1. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,支持双机集群扩展本地 AI

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日上市,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。

    推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的成本与扩展路径。

  2. NVIDIA Blog78

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。

    推荐理由:原文给出 Ultrafast 模式相对标准模式的 8 倍生成提速与开放入口,读者可据此判断它对编码智能体循环的实际影响。

  1. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。

  2. Google DeepMind60

    Google 为 Private AI Compute 引入安全服务端持久记忆

    Google Private AI Compute 团队公布为 Private AI Compute 平台引入私密服务端记忆的技术方案,让 AI 助手在跨设备场景下保留长期上下文,同时维持接近端侧的隐私标准。

    推荐理由:Google 公开了云端持久记忆的隐私架构细节,读者可据此判断跨设备 AI 记忆在隐私与工程上的取舍。

  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 这一进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。

    推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。

已经到底了