TypeSafe 上线三周 ARR 破 1 亿美元、估值 75 亿美元
[AINews] TypeSafe/Jev at >$100M ARR, $7.5B valuation 3 weeks after launch
Latent Space 的 AINews 汇总称,TypeSafe 在发布三周后 ARR 超过 1 亿美元、估值达 75 亿美元,其 Jev API 已被大量克隆。
汇总了决策模型、多智能体编排与推理系统多条同日进展,可快速把握智能体基础设施的走向。
正如你在下方 AINews X 回顾部分所看到的,地球上每个人都克隆了 Jev API,但只有一家公司能够开创这个品类。TypeSafe 宣布了他们的“Series AI”,而 Sequoia“泄露”称他们在第一周就突破了 1 亿美元 ARR。
尽管存在质疑者和对人为炒作的指控,我们希望显而易见的是,我们的 Jev 播客是 100% 真实的。
2026 年 10 月 8 日至 2026 年 10 月 9 日的 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter 账号,没有进一步检查 Discord。AINews 的网站让你可以搜索所有过往期刊。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择开启/关闭邮件频率!
AI Twitter 回顾
决策模型成为一个产品品类
模式:多家厂商在同一天发布了“决策”模型。这些模型在一次前向传播中返回类型化答案(概率、从列表中选择、分数),而不是自由文本。Jev 是所有人对标的参照点,@scaling01 评论了这种格式传播得有多快。
OpenAI Decisions API:三种请求类型:条件为真的概率、从列表中选择,或按等级评分。它接受文本和图像,运行在 GPT-6 Luna 上,输入 token 价格为 $0.10/M,输出不收费,并且按照 OpenAI 自己的说法“最高快 10 倍”(@LearnOpenCV)。
Microsoft-Decision-1:定位为 LLM 评判者和科学假设筛选。一位早期评估者表示,决策模型在一致性和复杂决策方面仍然吃力(@omarsar0)。
Perplexity pplx-decider-v1.1-27b:声称在 1,071 个案例中取得 Decision Bench 最高准确率 94.5%,价格为每 1K 次决策 $0.017(@perplexitydevs)。
Cloudflare clef:新的 clef-omni 接受音频、视频、图像和文本。clef-flash 现在比 Jev 更便宜,而 clef 整体大约快 2 倍(@michellechen)。权重已在 Hugging Face 上发布。
Liquid d1:现已上线 Vercel AI Gateway,支持视觉,用于分类、路由和评分任务(@vercel_dev)。
服务与路由:vLLM Semantic Router 的 Decision 2.0 在一次处理中回答关于同一输入的多个问题,并提供每个选项的概率(@vllm_project)。LangSmith 使用 Jev 作为评判者,在每条 trace 上分别返回关于难度和正确性的类型化答案(@hwchase17)。
训练你自己的模型:Unsloth 发布了一个免费 notebook,可在 8GB 显存上将 Qwen3.5-4B 转变为决策模型(@UnslothAI)。一篇关于 Qwen3.5-0.8B 的教程报告称,准确率在 60 步内从 37% 升至 65%,在 4GB 上大约需要 10 分钟(@akshay_pachaar)。
为什么 harness 需要这个:许多 agent 步骤是是/否调用,而不是生成。LangChain 表示,将每个任务路由到最便宜的足够好的模型,使 Open SWE 每个任务的中位成本降低了 64%(@hwchase17)。
相关研究:Apple/CMU 的基于选择的结构化推理(SSR)在 agent 内部应用了同样的思路(@ZhihuFrontier)。
方法:六种自然语言策略在一次共享 KV 缓存的批量前向传播中,通过长度归一化对数似然进行评分。
结果:每轮推理延迟下降超过 90%,但每个问题的端到端延迟仅下降 28–54%。在 Qwen3-VL-4B 上使用 GRPO 时,平均成功率为 61.37%,而 TAPO+GSPO 基线为 61.25%。
多智能体编排与编码工具
Claude Managed Agents 动态工作流(公开测试版):一个主导智能体编写分阶段计划,将其分发给每次运行最多 1,000 个智能体,然后合并结果。它通过
multiagent_20261001启用(@ClaudeDevs,配置)。成本警告:Anthropic 建议从范围明确的任务开始,因为 token 用量可能很高(指南)。
Claude Code Projects:所有在候补名单上的 Pro 和 Max 用户均已获准使用。每个项目以并行线程运行任务(@ClaudeDevs),会话现在可以在本地运行(@gem_ray)。
Opus 5.5 快速模式:它已经推出,但按使用额度计费,不包含在订阅中(@theo)。
智能体团队划算吗?:Vals AI 在 Vibe Code Bench 上分别以单独和团队形式运行了 GPT-6 Sol 和 Opus 5.5(@ValsAI)。
结果:团队成本高出 1.8–5.1 倍。只有中等投入的 Sol 有显著提升,提高了 7.3 分。
行为:Sol 按架构线并行委派。Opus 运行顺序波次,在最大投入下每个应用达到约 6.8 个子智能体和约 1,140 次子智能体工具调用,但没有显著收益(详情)。
Prime Agent 用 Rust 重写自身:在两周内,一个由 2,000 多个智能体组成的集群使用了 10K+ 个沙箱和 200B+ 个 GLM-5.3 token。结果达到可用输入的速度约快 13 倍,启动内存减少 83%(@PrimeIntellect)。一篇配套文章认为,上下文限制必然导致集群(文章)。
Codex 更新:
Windows 沙箱:一种基于 Microsoft Execution Containers (MXC) 构建的新模式,提供更快的设置、网络强制和细粒度文件控制(@OpenAIDevs)。
Composer 预测:Codex 现在会建议你的下一条消息,仅面向 Pro 用户的测试版(公告)。一些用户批评仅限 Pro 的门槛(@Angaisb_)。
可靠性:有用户抱怨持续一整天的中断(@dzhng)。
情绪:DHH 表示 GPT-6.1 Sol 让 Codex 取代 Claude 成为他的主要工具(@dhh)。
Devin 和 Grok Bot:Devin 现在可以生成受管 Devin 树,因此墙钟时间取决于最慢的分支,而不是总和(@devindevelopers)。Devin 还接受个人 ChatGPT 套餐用于 GPT 使用(@cognition)。另外,Grok Bot 获得了自己的电子邮件地址,用于注册和日程安排(@bot)。
模型发布与独立评估
Qwen-Image-2.1-Turbo(开放权重):7B Qwen-Image-2.1 的加速检查点。它支持 8 步 2K 生成和自然语言编辑,通过 Diffusers 加载
QwenImage21Pipeline,并与 Pro 和 Turbo API 一同发布(@Alibaba_Qwen)。StepFun Step 5 Preview:一个总参数 600B、激活 27B 的稀疏 MoE,具有 1M 上下文和视觉能力(@omarsar0)。
结果:它在 Hermes Index 上得分 33.89,与 GPT-6 Luna 持平,并在 Nous Portal 上免费开放一周(@NousResearch)。
可用性:它在 OpenRouter Trending 上排名第一,该榜单衡量的是使用量而非质量(@kimmonismus)。开放权重将于 10 月 15 日发布。最大输出已更正为 64K tokens(更正)。
Upstage Solar Mini 4:一个 35B MoE,激活 3B,524K 上下文,208 tok/s。其 AAII 得分 24 是 3B 激活级别中最好的,与 Nemotron 3 Ultra 仅差一分。在 Cline 中免费(@cline)。
Gemini 4 Argon:据报道在 DeepSWE v1.1 上达到 77.9%,而 Opus 5.5 为 74.2%。它首先向 650 多名 Fairwind Program 防御者提供,价格为每百万 tokens 2 美元/10 美元(@dl_weekly)。
信号:推理强度选择器已出现在 Antigravity 中(@testingcatalog),Logan Kilpatrick 表示“Argon 即将到来”(@OfficialLoganK)。
未经证实:Business Insider 报道称,一个内部“Carbon”检查点在编码方面接近 Opus 5.5。
语音模型:HeyGen Voice 以 1,201 的 Elo 位居 Artificial Analysis Controlled Voice TTS 竞技场榜首,价格为每百万字符 30 美元,每秒 40 字符(@ArtificialAnlys)。Whistle 是一个 16.9MB 的设备端 STT 模型,据称可与 Whisper base 媲美(@victormustar)。
多轮图像编辑:Artificial Analysis 连续进行了 30 次编辑(@ArtificialAnlys)。
结果:Ideogram 4.5 和 FLUX 3 在本地编辑,小编辑时 95% 以上的图像保持不变。GPT Image 2.5 Sunburst 每轮重新渲染大部分画面,仅约 20% 保持不变,因此会漂移。Nano Banana 2.1 逐渐变暗。
OCR 基准:Roboflow 的新基准覆盖 48 个模型,GPT-6 Astra 在文本定位方面领先(@skalskip92)。Datalab 的 OmniParseBench 包含 90 种语言的 16K 测试,其自己的模型并未排名第一(@VikParuchuri)。
竞技场汇总:Claude Haiku 5.5 在 WebDev 上排名第 30,价格为 0.10 美元/0.50 美元,与 GPT-6 Luna 价格相同,但得分高 6 分。Mistral Large 4 在 Agent Arena 上排名第 43(@arena)。在 ARC-AGI-3 上,新高分 59.17%(@arcprize)。
研究、训练与推理系统
Vera Rubin 上的 vLLM 和 SGLang:vLLM 报告在 AgentX 上匹配交互性时,MiniMax M3 的 GB200 吞吐量超过 7.8 倍。这些是早期结果(@vllm_project)。
技术:局部性感知 MoE 使用 CUDA 13.4 局部性域,使每个 SM 仅读取本地 HBM,MoE 解码速度最高提升 1.2 倍(详情)。
SGLang:在 128K 上下文下 FP8 MLA 最高提速 20%,MoE 尾部融合带来 5.9% 的端到端增益,每个解码步骤减少 276 次启动(@sgl_project)。
SemiAnalysis 声称:一份预览版 InferenceX 提交显示,与 GB300 相比,每吉瓦利润为 3.2 倍,每美元性能最高提升 10 倍(@SemiAnalysis_)。
TRL v1.15:融合 LM head 现已默认开启,避免物化完整的 logits 张量(@LysandreJik)。
结果:在 Gemma 3 1B 上,GRPO 序列长度从 28K 增加到 114K,DPO 从 10K 增加到 59K。8K 时的峰值内存下降 52–82%,训练速度最高提升约 11%。
数据与后训练服务:
Datology Curation Studio:声称在 39 个开放数据集上为 30B MoE 带来 6 倍算力倍增(@pratyushmaini)。它还引用了 Thomson-1,训练成本为 45 万美元,在与 GPT-5.6 Sol 的正面对决中胜出(@arimorcos)。
Tinker:价格最高下调 70%,长上下文与短上下文定价相同,并新增 GLM-5.3-Flash 和 DeepSeek-v4.1-Flash(@tinkerapi)。
DeepSeek 周期性弱点:字节跳动 Seed 发现,检索效果取决于 token 相对于压缩步长的落点(@ZhihuFrontier)。
证据:该模式在没有 RoPE 或学习门控的情况下依然存在,并且与步长相关。
解读:V4.1 的步长为 2,减轻了该效应,但并未消除。
智能体研究:
来源:Latent Space · latent.space