Mistral 发布 Mistral Large 4 预览版 Le chonk
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,在自有的 3800 块 NVIDIA Grace Blackwell GPU 集群上训练,目前通过其 API 提供。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,在自有的 3800 块 NVIDIA Grace Blackwell GPU 集群上训练,目前通过其 API 提供。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
推荐理由:Reflection 发布 501B 总参数的开源 MoE Beam,并给出预训练与 RL 训练规模细节,可对照同期开源模型判断其位置。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,已作为 Asta 的 Fast 模式上线,并同步开放权重和训练数据。
推荐理由:原文公开了 AstaBrief 的训练数据构造与引用过滤细节,可供做科学报告生成的团队参考。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。
推荐理由:原文给出覆盖全基因组的预计算预测与免费入口,读者可了解变异解读工具链的可用范围。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,用蒸馏自原 GigaPath ViT-g 的 22M 参数 ViT-S 编码器替换原有骨干,并以 Apache 2.0 许可开源。
微软研究院发布深度学习 DFT 交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正在集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。