AI Radar

模型

全球大模型的发布、更新、开源、价格变化和评测动态。

全部22新模型发布5版本更新0价格变化0开源权重0能力评测0

5 · 海外

  • Meta 发布 Muse 实时语音与虚拟形象架构

    Meta 公布 Muse Realtime Voice 与 Muse Realtime Avatar,两者通过共享的语音 token 流组成统一流式架构。Voice 生成同时编码内容与韵律的语音 token,Avatar 消费同一 token 流生成流式视频。系统以固定长度历史作为后续分块的动作上下文,使任意长度对话下的计算量保持有界,并同步生成语音、唇动和表情。原文未披露模型规模、延迟数据与开放时间。

    X @AIatMeta2 小时前海外新模型发布41
  • Contrastive-LM 发布 CLM-8B:给 Agent 动作打分比 Jev 快 9 倍

    Contrastive-LM 发布 CLM-8B,首个开源 Contrastive Language Model(CLM)。它不生成文本,而是对候选动作打分并返回概率,对标 TypeSafe AI 的专有 System One 模型 Jev。Apache-2.0 授权,头部权重仅 75 MB,单张 NVIDIA GPU 即可运行,用 vLLM 服务 Qwen3-8B 编码器。训练分三阶段:约 6000 万 Nemotron DQA 问答对预训练、约 3000 万 Gemini 2.5 Flash-Lite 合成难负样本中期训练、约 100 万条 Agent 轨迹后训练。在约 10 万条留出问题上,仅预训练 top-1 准确率 52.1%,中期训练提升至 69.2%。T-Rex 游戏任务延迟 16.5 ms 对 Jev 的 149.8 ms,即 9 倍加速;

    MarkTechPost2 小时前海外新模型发布40
  • TypeSafe AI 发布 Jev:不生成文本,只返回类型化决策

    TypeSafe AI 推出首个 System One 模型 Jev,不生成任何文本,而是接收程序状态和一组类型化问题,返回选项、分数和是/否概率,供代码直接分支。官方 Python SDK 为 typesafe-sdk 0.7.0,输入 token 定价 0.042 美元/百万,输出 token 免费。教程演示了置信度门控路由、代码内保留权重的复合评分、类型化函数调用,以及用 Pydantic 响应模型、asyncio 异步扇出、重试策略和成本账本构建生产形态。

    MarkTechPost7 小时前海外新模型发布37
  • Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google 发布两款 Gemini Audio 系列语音模型:Gemini 3.8 Flash TTS 面向创意配音与角色设计,Flash-Lite TTS 面向高并发低成本生产,均通过 Gemini API 和 AI Studio 提供,仅 API 调用、不开源权重。新模型支持用自然语言逐句指导语气、节奏、方言,可从文本提示生成新音色,覆盖 100 多种语言和方言,并提供 2000+ 现成音色库。语音复刻需 30 秒样本和声音所有者口头同意录音,所有输出带 SynthID 水印。

    MarkTechPost11 小时前海外新模型发布39
  • NVIDIA 开源 100M 参数说话人分离模型 Nemotron 3

    NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,100M 参数,最多同时跟踪 8 位说话人,支持语音重叠场景,一个 checkpoint 同时覆盖离线录音与实时流式。权重采用 OpenMDW License 1.1,允许商用,通过 NVIDIA NeMo 在 Linux 上运行,支持 Ampere、Ada Lovelace、Hopper、Blackwell GPU。相比此前支持 4 人的 Streaming Sortformer,说话人上限翻倍。模型接收 16 kHz 单声道音频,输出每位说话人的活动概率,提供 4 档延迟配置:离线 30.4 s 缓冲 DER 12.73%,最低推荐 0.32 s 缓冲 DER 13.55%。

    OpenRouter 公告13 小时前海外新模型发布2 个信源55