数学家呼吁抵制 OpenAI:AI 生成证明涌入数学界
数学界部分人士呼吁抵制 OpenAI,起因是该公司一次性放出 700 多份 AI 生成的数学证明文件。菲尔兹奖得主 Terence Tao 在博客转发相关声明并提出“Math 2.0”,Scott Aaronson 则称之为“Mathocalypse”。
推荐理由:围绕 OpenAI 一次性放出 700 多份 AI 数学证明,呈现数学界对署名、可验证性与研究节奏的两种应对路线。
数学界部分人士呼吁抵制 OpenAI,起因是该公司一次性放出 700 多份 AI 生成的数学证明文件。菲尔兹奖得主 Terence Tao 在博客转发相关声明并提出“Math 2.0”,Scott Aaronson 则称之为“Mathocalypse”。
推荐理由:围绕 OpenAI 一次性放出 700 多份 AI 数学证明,呈现数学界对署名、可验证性与研究节奏的两种应对路线。
Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 在 Latent Space 的一场对谈中指出,AlphaFold 的突破只是开始,蛋白质结构预测远未解决,静态结构预测无法覆盖蛋白质动态与无序性。
哈佛大学研究者 Fiona Chen 和 James Stratton 基于 Jellyfish 的工程分析数据,覆盖 2021 年至 2026 年 3 月间 700 多家软件开发公司、70 多万名员工的 3 亿条工作事件(如提交和 pull request),发现人工代码审查成为 AI 编码工具整体效率的显著瓶颈。
Anthropic 为 Claude 推出两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。
Periodic Labs 联合创始人 Liam Fedus 与 Ekin Dogus Cubuk 在 Latent Space 播客中提出"合成超级智能"(synthesis superintelligence)路线:以物理实验为环境的强化学习、AI 材料表征、DFT 与高通量实验室,让模型学习做科学的全过程而非只看已发表结果。
AWS 发布基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群并保持隔离与资源公平。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软研究院开源了可直接复用真实 harness 的轻量智能体 RL 框架,并给出 6000 样本训练编码智能体的完整流程与实测增益。
OpenAI 从一个未公开的内部前沿模型发布了一批数学成果,公开在 GitHub 仓库中,共 722 篇手稿、归入 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果约用 3 小时 ChatGPT Pro 思考算力。
推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可据此了解其规模、算力成本与外界质疑。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 协议在本月放出。
推荐理由:Reflection 首次发布开源权重模型 Beam,给出训练规模、评测成绩与算力投入,可对照同期中美开源模型的位置。
MIT Technology Review 基于对 300 名数据与 AI 高管的调研发现,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识、上下文缺失与遗留数据系统是主要失败点。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已获 FDA 许可,用于自动评估乳腺密度。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测与 AE、Dst 指数预测,为美国本土 66,935 座变电站生成 30-60 分钟前的分区空间天气风险估计。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解 AI 生成蛋白质如何在保留功能的同时被标记与筛查。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨模态生物学世界模型和连接科学工具、文献、湿实验与研究者的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向推进工作。该实验室与新加坡医疗生态合作探索多模态医疗 AI 和自演化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc,通过学习式重排序整合两者互补预测,在十项挑战性多步合成任务中成功 9 项,优于 de novo 模型的 5 项、编辑模型的 4 项和 NeuralSym 的 2 项。盲测中化学家更偏好其单步反应预测。
Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过免费网站门户向学术研究开放。
推荐理由:AlphaGenome Atlas 把 90 亿个单核苷酸变异的预测结果做成可检索资源,读者可了解其数据规模与 AVI 评分的实际用法。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,均以 Apache 2.0 许可开源。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重构的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体设计(Data Systems For Agents)、由智能体运行(Of Agents)、由智能体合成(By Agents)。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型带来的脆弱梯度问题。