Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 与订阅计划价格。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 与订阅计划价格。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
Mistral 推出 Mistral Large 4,模型可通过 llm 命令行工具以 mistral/mistral-large-4 调用。Simon Willison 用同一提示词让 Mistral Large 4 与 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash 分别生成"穿渔网袜在火星乱穿马路的犰狳"SVG,作为对基准测试饱和的调侃。
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价为 $0.10/$0.50 每百万 token,与 OpenAI 上月发布的 GPT-6 Luna 一致,超过 100,000 token 后涨至 $0.50/$2.50。
推荐理由:作者实测了 Haiku 5.5 的定价、tokenizer 变化与推理档位表现,可据此判断不同用量下的成本取舍。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
推荐理由:Reflection 发布 501B 总参数的开源 MoE Beam,并给出预训练与 RL 训练规模细节,可对照同期开源模型判断其位置。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,目前仅向政府用户和 Fairwind 计划中的可信网络防御者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与第三方评测差异,可对照其与 Astra、Opus 5.5 的取舍。
微软研究院发布深度学习 DFT 交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正在集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。