跳到正文
Latent Space·· 2 小时前精选

TypeSafe 上线三周 ARR 破 1 亿美元、估值 75 亿美元

[AINews] TypeSafe/Jev at >$100M ARR, $7.5B valuation 3 weeks after launch

AI 导读

Latent Space 的 AINews 汇总称,TypeSafe 在发布三周后 ARR 超过 1 亿美元、估值达 75 亿美元,其 Jev API 已被大量克隆。

推荐理由

汇总了决策模型、多智能体编排与推理系统多条同日进展,可快速把握智能体基础设施的走向。

正文 · AI 翻译

正如你在下方 AINews X 回顾部分所看到的,地球上每个人都克隆了 Jev API,但只有一家公司能够开创这个品类。TypeSafe 宣布了他们的“Series AI”,而 Sequoia“泄露”称他们在第一周就突破了 1 亿美元 ARR。

尽管存在质疑者和对人为炒作的指控,我们希望显而易见的是,我们的 Jev 播客是 100% 真实的。

2026 年 10 月 8 日至 2026 年 10 月 9 日的 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter 账号,没有进一步检查 Discord。AINews 的网站让你可以搜索所有过往期刊。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择开启/关闭邮件频率!


AI Twitter 回顾

决策模型成为一个产品品类

  • 模式:多家厂商在同一天发布了“决策”模型。这些模型在一次前向传播中返回类型化答案(概率、从列表中选择、分数),而不是自由文本。Jev 是所有人对标的参照点,@scaling01 评论了这种格式传播得有多快。

    • OpenAI Decisions API:三种请求类型:条件为真的概率、从列表中选择,或按等级评分。它接受文本和图像,运行在 GPT-6 Luna 上,输入 token 价格为 $0.10/M,输出不收费,并且按照 OpenAI 自己的说法“最高快 10 倍”(@LearnOpenCV)。

    • Microsoft-Decision-1:定位为 LLM 评判者和科学假设筛选。一位早期评估者表示,决策模型在一致性和复杂决策方面仍然吃力(@omarsar0)。

    • Perplexity pplx-decider-v1.1-27b:声称在 1,071 个案例中取得 Decision Bench 最高准确率 94.5%,价格为每 1K 次决策 $0.017(@perplexitydevs)。

    • Cloudflare clef:新的 clef-omni 接受音频、视频、图像和文本。clef-flash 现在比 Jev 更便宜,而 clef 整体大约快 2 倍(@michellechen)。权重已在 Hugging Face 上发布。

    • Liquid d1:现已上线 Vercel AI Gateway,支持视觉,用于分类、路由和评分任务(@vercel_dev)。

  • 服务与路由:vLLM Semantic Router 的 Decision 2.0 在一次处理中回答关于同一输入的多个问题,并提供每个选项的概率(@vllm_project)。LangSmith 使用 Jev 作为评判者,在每条 trace 上分别返回关于难度和正确性的类型化答案(@hwchase17)。

  • 训练你自己的模型:Unsloth 发布了一个免费 notebook,可在 8GB 显存上将 Qwen3.5-4B 转变为决策模型(@UnslothAI)。一篇关于 Qwen3.5-0.8B 的教程报告称,准确率在 60 步内从 37% 升至 65%,在 4GB 上大约需要 10 分钟(@akshay_pachaar)。

  • 为什么 harness 需要这个:许多 agent 步骤是是/否调用,而不是生成。LangChain 表示,将每个任务路由到最便宜的足够好的模型,使 Open SWE 每个任务的中位成本降低了 64%(@hwchase17)。

  • 相关研究:Apple/CMU 的基于选择的结构化推理(SSR)在 agent 内部应用了同样的思路(@ZhihuFrontier)。

    • 方法:六种自然语言策略在一次共享 KV 缓存的批量前向传播中,通过长度归一化对数似然进行评分。

    • 结果:每轮推理延迟下降超过 90%,但每个问题的端到端延迟仅下降 28–54%。在 Qwen3-VL-4B 上使用 GRPO 时,平均成功率为 61.37%,而 TAPO+GSPO 基线为 61.25%。

多智能体编排与编码工具

  • Claude Managed Agents 动态工作流(公开测试版):一个主导智能体编写分阶段计划,将其分发给每次运行最多 1,000 个智能体,然后合并结果。它通过 multiagent_20261001 启用(@ClaudeDevs,配置)。

    • 成本警告:Anthropic 建议从范围明确的任务开始,因为 token 用量可能很高(指南)。

    • Claude Code Projects:所有在候补名单上的 Pro 和 Max 用户均已获准使用。每个项目以并行线程运行任务(@ClaudeDevs),会话现在可以在本地运行(@gem_ray)。

    • Opus 5.5 快速模式:它已经推出,但按使用额度计费,不包含在订阅中(@theo)。

  • 智能体团队划算吗?:Vals AI 在 Vibe Code Bench 上分别以单独和团队形式运行了 GPT-6 Sol 和 Opus 5.5(@ValsAI)。

    • 结果:团队成本高出 1.8–5.1 倍。只有中等投入的 Sol 有显著提升,提高了 7.3 分。

    • 行为:Sol 按架构线并行委派。Opus 运行顺序波次,在最大投入下每个应用达到约 6.8 个子智能体和约 1,140 次子智能体工具调用,但没有显著收益(详情)。

  • Prime Agent 用 Rust 重写自身:在两周内,一个由 2,000 多个智能体组成的集群使用了 10K+ 个沙箱和 200B+ 个 GLM-5.3 token。结果达到可用输入的速度约快 13 倍,启动内存减少 83%(@PrimeIntellect)。一篇配套文章认为,上下文限制必然导致集群(文章)。

  • Codex 更新:

    • Windows 沙箱:一种基于 Microsoft Execution Containers (MXC) 构建的新模式,提供更快的设置、网络强制和细粒度文件控制(@OpenAIDevs)。

    • Composer 预测:Codex 现在会建议你的下一条消息,仅面向 Pro 用户的测试版(公告)。一些用户批评仅限 Pro 的门槛(@Angaisb_)。

    • 可靠性:有用户抱怨持续一整天的中断(@dzhng)。

    • 情绪:DHH 表示 GPT-6.1 Sol 让 Codex 取代 Claude 成为他的主要工具(@dhh)。

  • Devin 和 Grok Bot:Devin 现在可以生成受管 Devin 树,因此墙钟时间取决于最慢的分支,而不是总和(@devindevelopers)。Devin 还接受个人 ChatGPT 套餐用于 GPT 使用(@cognition)。另外,Grok Bot 获得了自己的电子邮件地址,用于注册和日程安排(@bot)。

模型发布与独立评估

  • Qwen-Image-2.1-Turbo(开放权重):7B Qwen-Image-2.1 的加速检查点。它支持 8 步 2K 生成和自然语言编辑,通过 Diffusers 加载 QwenImage21Pipeline,并与 Pro 和 Turbo API 一同发布(@Alibaba_Qwen)。

  • StepFun Step 5 Preview:一个总参数 600B、激活 27B 的稀疏 MoE,具有 1M 上下文和视觉能力(@omarsar0)。

    • 结果:它在 Hermes Index 上得分 33.89,与 GPT-6 Luna 持平,并在 Nous Portal 上免费开放一周(@NousResearch)。

    • 可用性:它在 OpenRouter Trending 上排名第一,该榜单衡量的是使用量而非质量(@kimmonismus)。开放权重将于 10 月 15 日发布。最大输出已更正为 64K tokens(更正)。

  • Upstage Solar Mini 4:一个 35B MoE,激活 3B,524K 上下文,208 tok/s。其 AAII 得分 24 是 3B 激活级别中最好的,与 Nemotron 3 Ultra 仅差一分。在 Cline 中免费(@cline)。

  • Gemini 4 Argon:据报道在 DeepSWE v1.1 上达到 77.9%,而 Opus 5.5 为 74.2%。它首先向 650 多名 Fairwind Program 防御者提供,价格为每百万 tokens 2 美元/10 美元(@dl_weekly)。

    • 信号:推理强度选择器已出现在 Antigravity 中(@testingcatalog),Logan Kilpatrick 表示“Argon 即将到来”(@OfficialLoganK)。

    • 未经证实:Business Insider 报道称,一个内部“Carbon”检查点在编码方面接近 Opus 5.5。

  • 语音模型:HeyGen Voice 以 1,201 的 Elo 位居 Artificial Analysis Controlled Voice TTS 竞技场榜首,价格为每百万字符 30 美元,每秒 40 字符(@ArtificialAnlys)。Whistle 是一个 16.9MB 的设备端 STT 模型,据称可与 Whisper base 媲美(@victormustar)。

  • 多轮图像编辑:Artificial Analysis 连续进行了 30 次编辑(@ArtificialAnlys)。

    • 结果:Ideogram 4.5 和 FLUX 3 在本地编辑,小编辑时 95% 以上的图像保持不变。GPT Image 2.5 Sunburst 每轮重新渲染大部分画面,仅约 20% 保持不变,因此会漂移。Nano Banana 2.1 逐渐变暗。

  • OCR 基准:Roboflow 的新基准覆盖 48 个模型,GPT-6 Astra 在文本定位方面领先(@skalskip92)。Datalab 的 OmniParseBench 包含 90 种语言的 16K 测试,其自己的模型并未排名第一(@VikParuchuri)。

  • 竞技场汇总:Claude Haiku 5.5 在 WebDev 上排名第 30,价格为 0.10 美元/0.50 美元,与 GPT-6 Luna 价格相同,但得分高 6 分。Mistral Large 4 在 Agent Arena 上排名第 43(@arena)。在 ARC-AGI-3 上,新高分 59.17%(@arcprize)。

研究、训练与推理系统

  • Vera Rubin 上的 vLLM 和 SGLang:vLLM 报告在 AgentX 上匹配交互性时,MiniMax M3 的 GB200 吞吐量超过 7.8 倍。这些是早期结果(@vllm_project)。

    • 技术:局部性感知 MoE 使用 CUDA 13.4 局部性域,使每个 SM 仅读取本地 HBM,MoE 解码速度最高提升 1.2 倍(详情)。

    • SGLang:在 128K 上下文下 FP8 MLA 最高提速 20%,MoE 尾部融合带来 5.9% 的端到端增益,每个解码步骤减少 276 次启动(@sgl_project)。

    • SemiAnalysis 声称:一份预览版 InferenceX 提交显示,与 GB300 相比,每吉瓦利润为 3.2 倍,每美元性能最高提升 10 倍(@SemiAnalysis_)。

  • TRL v1.15:融合 LM head 现已默认开启,避免物化完整的 logits 张量(@LysandreJik)。

    • 结果:在 Gemma 3 1B 上,GRPO 序列长度从 28K 增加到 114K,DPO 从 10K 增加到 59K。8K 时的峰值内存下降 52–82%,训练速度最高提升约 11%。

  • 数据与后训练服务:

    • Datology Curation Studio:声称在 39 个开放数据集上为 30B MoE 带来 6 倍算力倍增(@pratyushmaini)。它还引用了 Thomson-1,训练成本为 45 万美元,在与 GPT-5.6 Sol 的正面对决中胜出(@arimorcos)。

    • Tinker:价格最高下调 70%,长上下文与短上下文定价相同,并新增 GLM-5.3-Flash 和 DeepSeek-v4.1-Flash(@tinkerapi)。

  • DeepSeek 周期性弱点:字节跳动 Seed 发现,检索效果取决于 token 相对于压缩步长的落点(@ZhihuFrontier)。

    • 证据:该模式在没有 RoPE 或学习门控的情况下依然存在,并且与步长相关。

    • 解读:V4.1 的步长为 2,减轻了该效应,但并未消除。

  • 智能体研究:

    • 智能体可塑性(Meta):衡量每单位学习成本带来的留出集增益。表现最好的并非学习效率最高的(@omarsar0)。

    • MIMESIS:一个 9B 用户模拟器,在行为保真度上以 13.4 分的优势击败 Opus 5(@dair_ai)。

    • 基座模型选择(NVIDIA):根据基座模型能否复现“决定性编辑”对检查点进行排名,该信号与后训练后的 SWE-bench Verified 分数相关(@dair_ai)。

阅读更多

来源:Latent Space · latent.space