Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 的价格和订阅方案。
推荐理由:汇总了 Haiku 5.5 的定价、独立评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
内容形态
模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。
3 条精选近 30 天 3 条共收录 6 条
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 的价格和订阅方案。
推荐理由:汇总了 Haiku 5.5 的定价、独立评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 协议在本月放出。
推荐理由:Reflection 首次发布开源权重模型 Beam,给出训练规模、评测成绩与算力投入,可对照同期中美开源模型的位置。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个公开 pull request,并配有公开评分标准与 LLM 评判器。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线信号,读者可据此判断评测结果与线上表现的关系。