研究:AI 编码智能体生成更多代码,但软件产出并未增加
哈佛大学研究者 Fiona Chen 和 James Stratton 基于 Jellyfish 的工程分析数据,覆盖 2021 年至 2026 年 3 月间 700 多家软件开发公司、70 多万名员工的 3 亿条工作事件(如提交和 pull request),发现人工代码审查成为 AI 编码工具整体效率的显著瓶颈。
哈佛大学研究者 Fiona Chen 和 James Stratton 基于 Jellyfish 的工程分析数据,覆盖 2021 年至 2026 年 3 月间 700 多家软件开发公司、70 多万名员工的 3 亿条工作事件(如提交和 pull request),发现人工代码审查成为 AI 编码工具整体效率的显著瓶颈。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request,并配有公开评分标准与 LLM 评判器。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线信号,读者可据此判断评测结果与线上表现的关系。