跳到正文
今天10月10日周六3 条
  1. The Verge · AI88

    OpenAI 一次性放出近 400 项数学结果,数学家称需数年消化

    OpenAI 本周发布近 400 项 AI 生成的数学结果,分布在 700 多篇手稿中,覆盖组合数学、几何、数论、理论计算机科学、代数、拓扑、概率与统计力学、数学物理等多个方向。

    推荐理由:通过数十位数学家的第一手反应,呈现OpenAI一次性放出近400项结果对学术生态的冲击与验证缺口。

10月9日周五
  1. The Decoder60

    Anthropic 的 Claude Science 首次绘制完整紫外天图

    Anthropic 的 Claude Science 首次绘制出完整的紫外天图,该项目意在展示 AI 如何接手研究人员长期搁置的繁琐数据工作。Claude Science 协调多个 AI 智能体从多个太空任务下载数据、进行校准并合并,再用 inpainting 技术补全缺失区域;测试中预测值与实际测量平均偏差约 10%。

10月7日周三
  1. Latent Space83

    OpenAI 内部模型发布 722 篇数学手稿,称解决 500 个公开数学难题中的 90 个

    OpenAI 从一个未公开的内部前沿模型发布了一批数学成果,公开在 GitHub 仓库中,共 722 篇手稿、归入 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果约用 3 小时 ChatGPT Pro 思考算力。

    推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可据此了解其规模、算力成本与外界质疑。

10月5日周一
  1. GitHub Blog · AI & ML62

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request,并配有公开评分标准与 LLM 评判器。

    推荐理由:GitHub 公开了代码审查基准的构建方法与离线信号,读者可据此判断评测结果与线上表现的关系。

10月1日周四
9月24日周四
  1. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。

9月21日周一
  1. Microsoft Research40

    微软开源逆合成模型 RetroChimera,成果登上 Nature

    微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc,通过学习式重排序整合两者互补预测,在十项挑战性多步合成任务中成功 9 项,优于 de novo 模型的 5 项、编辑模型的 4 项和 NeuralSym 的 2 项。盲测中化学家更偏好其单步反应预测。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 这一进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。

    推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。

7月26日周日
  1. Berkeley AI Research34

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重构的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。

5月8日周五
4月20日周一
  1. Berkeley AI Research34

    GRASP:面向世界模型的梯度规划方法,让长时程规划更稳健

    Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型带来的脆弱梯度问题。

3月13日周五
1月10日周六
  1. Berkeley AI Research26

    伯克利提出信息驱动的成像系统设计框架,登 NeurIPS 2025

    伯克利 AI Research 提出基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化信息含量,在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。