跳到正文
10月9日周五
10月8日周四
  1. AWS Machine Learning Blog62

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 称它是 Claude 5.5 系列中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与在 Bedrock 上的接入方式,便于判断它在多智能体分层中的位置。

  2. GitHub Blog · AI & ML60

    GitHub 推出基于 ModernBERT 的密钥检测模型,扩展 push protection

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提高一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露与代码量同步增长,并给出把检测前移到 push 环节的模型方案。

  3. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源了可直接复用真实 harness 的轻量智能体 RL 框架,并给出 6000 样本训练编码智能体的完整流程与实测增益。

10月7日周三
  1. AWS Machine Learning Blog22

    超越节省工时:为智能体自动化构建商业论证

    AWS 提出"智能体价值模型",用于替代为 RPA 设计的传统 ROI 算法,从时间节省、异常处理、决策质量和变更韧性四个维度衡量智能体自动化的价值。该框架引用 McKinsey 的"1:3:5 模式",并给出理赔分诊示例:20 万件理赔、每件约 12 分钟、时薪 $45,自动化 70% 常规工作可释放约 28,000 小时,但释放工时并不等于节省成本。

10月6日周二
10月5日周一
10月2日周五
  1. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,支持双机集群扩展本地 AI

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日上市,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。

    推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的成本与扩展路径。

10月1日周四
9月25日周五
9月24日周四
  1. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。

  2. Google DeepMind60

    Google 为 Private AI Compute 引入安全服务端持久记忆

    Google Private AI Compute 团队公布为 Private AI Compute 平台引入私密服务端记忆的技术方案,让 AI 助手在跨设备场景下保留长期上下文,同时维持接近端侧的隐私标准。

    推荐理由:Google 公开了云端持久记忆的隐私架构细节,读者可据此判断跨设备 AI 记忆在隐私与工程上的取舍。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 这一进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。

    推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。

7月7日周二
5月8日周五