Contrastive-LM 发布了 CLM-8B,这是名为对比语言模型(Contrastive Language Models,CLMs)的新类别中的首个开放模型。CLM 不生成文本。它针对当前状态对一组候选动作进行评分并返回概率。其主要基线是 Jev,即 TypeSafe AI 的专有 System One 模型。
它可部署吗?可以。Apache-2.0 权重仅 75 MB。它可在 Linux 下运行于 1 块 NVIDIA GPU,由 vLLM 为 Qwen3-8B 编码器提供服务。
System One 模型的作用
Jev 于 2026 年 9 月 15 日进入有限早期访问。它返回带概率的类型化值而非文本。CLM 面向相同的接口。CLM 的 GitHub 仓库在兼容 TypeSafe 的 API 后提供 CLM-8B。它暴露 3 种问题类型:
Noul:返回某个陈述为真的概率。
Choice:从声明的集合中选出一个选项,并给出概率。
Score:在有序评分标准上返回一个预期等级。
为 TypeSafe 的 API 编写的请求可以通过 CLM 的 Python 客户端重放。
CLM 的工作原理
CLM 使用双向 InfoNCE 损失训练状态编码器和动作编码器。每个编码器都是一个冻结的 Qwen3-8B 主干加上一个 2000 万参数的可训练投影头。训练将每个状态拉向实际采取的动作,并推离其他动作。
在推理时,CLM 通过状态和动作嵌入的点积对每个候选进行评分。对这些分数做 softmax 即成为答案分布。同一原语可用于对 best-of-N 解决方案排序、路由工具以及回答类型化决策。
这种设计将状态和动作解耦。在智能体循环中,状态每一步都会变化,而动作集基本保持固定。clm-serve 预留一块 GPU 内存,类似于 vLLM 的 KV 缓存,并复用缓存的向量。在 1 块 RTX 4090 上、3 个动作时,重复访问的状态从 1.7 ms 降至 0.6 ms。模型卡报告称,在约 1,000 个候选时,CLM 的运行速度比 Jev 快 13 倍。
3 阶段训练配方
在约 6000 万条 Nemotron DQA 问答对上预训练。
在约 3000 万条由 Gemini 2.5 Flash-Lite 生成的合成困难负样本上做中期训练。
在来自 Agent Data Protocol、Endless-Terminals 和 LiteCoder-Terminal-SFT 的约 100 万条智能体轨迹上做后训练。
在约 100K 个留出问题上,仅靠预训练即可达到 52.1% 的 top-1 准确率。中期训练将其提升至 69.2%。从一开始就使用难负样本训练最高达到 62.4%,随后出现过拟合。
针对 Jev 的零样本结果
任务CLM-8B 延迟Jev 延迟CLM-8B 成功率Jev 成功率T-Rex 游戏16.5 ms149.8 ms5/55/5工具调用(BFCL v4)76.8 ms125.5 ms95.2%99.2%WikiRacing79.8 ms225 ms26/3030/30Super Mario33.5 ms132.6 ms5/55/5
9× 这个数字来自 T-Rex 游戏,其中动作在不同状态间重复。CLM 在 T-Rex 和 Super Mario 上与 Jev 持平。它在工具调用和 WikiRacing 上落后,但在每个任务上都运行得更快。
CLM 作为编码智能体的验证器
在这里,生成器采样若干候选解决方案,验证器挑选其中一个。Opus 5 生成了 DeepSWE 候选(best-of-4)。Fable 5 生成了 Terminal-Bench 2.1 候选(best-of-5)。团队评估了 38 个留出的 DeepSWE 任务和 30 个留出的 Terminal-Bench 2.1 任务。延迟在 H100 上测量。
基准测试Pass@1CLM(微调)JevCLM 延迟Jev 延迟DeepSWE73.7%81.6%71.1%79 ms449 msTerminal-Bench 2.184.0%87.6%83.1%32 ms131 ms
研究团队将这些报告为新的 SOTA 验证器结果。Jev 在两个基准测试上的得分都低于 pass@1,因此用 Jev 进行选择还不如直接取 1 个样本。CLM 运行速度快 4.1× 到 5.7×。这些数字使用的是轻量级微调头,而非零样本检查点。它们是留出子集的结果,而非完整的排行榜提交。
交互式讲解器
关键要点
CLM-8B 对候选动作打分,而不是生成文本。
在零样本测试中,延迟比 Jev 低最多 9×。
微调头在 DeepSWE 和 Terminal-Bench 2.1 子集上分别达到 81.6% 和 87.6%。
缓存的状态和动作向量降低了智能体循环的延迟。
Apache-2.0 头,在 1 块 NVIDIA GPU 上自托管。
查看 Blog、Code 以及 Data & Models。所有功劳归于该项目的研究者。另外,欢迎在 Twitter 上关注我们,别忘了加入我们 150k+ 的 ML SubReddit 并订阅我们的 Newsletter。等等!你在 telegram 上吗?现在你也可以在 telegram 上加入我们。
需要与我们合作来推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会等?联系我们
文章 Contrastive-LM Releases CLM-8B: An Open System One Model That Scores Agent Actions Up to 9× Faster Than Jev 首次发布于 MarkTechPost。