AI Radar

全部资讯

全部资讯模型
31
X @AIatMeta1 小时前模型新模型发布海外

Meta 发布 Muse 实时语音与虚拟形象架构

Meta 公布 Muse Realtime Voice 与 Muse Realtime Avatar,两者通过共享的语音 token 流组成统一流式架构。Voice 生成同时编码内容与韵律的语音 token,Avatar 消费同一 token 流生成流式视频。系统以固定长度历史作为后续分块的动作上下文,使任意长度对话下的计算量保持有界,并同步生成语音、唇动和表情。原文未披露模型规模、延迟数据与开放时间。

推荐理由做实时数字人或语音 Agent 的可以看这套共享 token 流的同步思路

X @MiniMax_AI1 小时前模型产品发布/更新海外

MiniMax-H3 登陆 AMD MI355X,推理提速 26.7 倍

NunchuxAI 将 MiniMax 的视频生成模型 MiniMax-H3 部署到 AMD MI355X,8 卡推理速度最高比 SGLang 快 26.7 倍,5 秒视频生成耗时 1.3 秒。该方案支持流式生成,视频播放过程中可修改 prompt 来引导后续画面走向。MiniMax 表示 MiniMax-H3 的免费访问即将开放,目前可加入 waitlist。

推荐理由5 秒视频 1.3 秒出,比 SGLang 快 26.7 倍,做视频生成部署的可以盯 AMD 这条路线

MarkTechPost1 小时前模型新模型发布海外

Contrastive-LM 发布 CLM-8B:给 Agent 动作打分比 Jev 快 9 倍

Contrastive-LM 发布 CLM-8B,首个开源 Contrastive Language Model(CLM)。它不生成文本,而是对候选动作打分并返回概率,对标 TypeSafe AI 的专有 System One 模型 Jev。Apache-2.0 授权,头部权重仅 75 MB,单张 NVIDIA GPU 即可运行,用 vLLM 服务 Qwen3-8B 编码器。训练分三阶段:约 6000 万 Nemotron DQA 问答对预训练、约 3000 万 Gemini 2.5 Flash-Lite 合成难负…

推荐理由单卡可跑、权重 75 MB,Agent 动作打分延迟从 150 ms 降到 16 ms,做 Agent 循环可直接换

MarkTechPost6 小时前模型新模型发布海外

TypeSafe AI 发布 Jev:不生成文本,只返回类型化决策

TypeSafe AI 推出首个 System One 模型 Jev,不生成任何文本,而是接收程序状态和一组类型化问题,返回选项、分数和是/否概率,供代码直接分支。官方 Python SDK 为 typesafe-sdk 0.7.0,输入 token 定价 0.042 美元/百万,输出 token 免费。教程演示了置信度门控路由、代码内保留权重的复合评分、类型化函数调用,以及用 Pydantic 响应模型、asyncio 异步扇出、重试策略和成本账本构建生产形态。

推荐理由输入 0.042 美元/百万、输出免费,做置信度路由和类型化决策可直接照抄代码

TechCrunch AI7 小时前模型产品发布/更新海外2 个独立信源

Meta 发布无摄像头 AI 眼镜,349 美元起

Meta 在 Connect 2026 大会上发布首款无摄像头 AI 眼镜 Ray-Ban Meta Audio,起售价 349 美元,10 月 13 日开启预售。该产品仅支持音频功能:听音乐播客、通话、语音翻译和与 Meta AI 助手 Muse 对话,重 43 克,单次充电续航 12 小时,配合充电盒可达 48 小时,提供 23 种颜色与镜片组合。Meta 称此举是为回应外界对 AI 眼镜偷拍问题的批评。同时发布带摄像头的 Ray-Ban Meta(Gen 3),配备 1200 万像素摄像头、支持 3K 视频、…

推荐理由349 美元、43 克、12 小时续航,想买 AI 眼镜的可以先看这款无摄像头版本

The Verge AI7 小时前模型产品发布/更新海外

Meta 为 Muse 增加邮箱、视频通话和 Mac 控制能力

Meta 宣布为 AI Agent Muse 增加多项更新:Muse 将拥有自己的电子邮箱地址,可用来完成任务,用户也能通过该邮箱与 Agent 沟通;Mac 版 Muse 应用将获得操作用户电脑的能力;用户很快可以通过视频通话与 Muse 虚拟形象实时对话,并可调整其声音,新的 Muse Realtime Avatar 模型负责其动作表现。Muse 本月早些时候上线,曾登顶 App Store 榜单,据报道其移动端上线前 12 天下载量超过 ChatGPT。Meta 还计划未来几个月将 Muse 上线其智能眼镜。

推荐理由Muse 上线 12 天下载量超 ChatGPT,Agent 加邮箱和视频通话是产品形态的新信号

TechCrunch AI8 小时前模型行业动态海外2 个独立信源

Anthropic 生物实验室称发现类 CRISPR 酶系统

Anthropic 宣布其湾区湿实验室发现一种此前未知的酶系统,藏在噬菌体 DNA 中,能像 CRISPR 一样切割、复制和粘贴 DNA。CEO Dario Amodei 称该发现主要由 Claude 完成,Claude 调用约 950 个 agent、消耗 2.1 亿 token,仅用 21 小时。他同时承认斯坦福团队此前发现过类似系统,发现的实际价值有待学界验证。实验室仅做 BSL-1 和 BSL-2 级别研究,不接触可感染人类的病原体,所有实验由人类科学家操作。

推荐理由21 小时、950 个 agent、2.1 亿 token 换一个生物发现,可看 AI 做科研的真实成本与边界

Ars Technica AI9 小时前模型行业动态海外

宾利发布首款纯电车型 Torcal

宾利正式发布品牌首款纯电车型 Torcal,命名取自西班牙一处岩石地貌。标准版峰值输出 810 hp(604 kW)、880 lb-ft(1194 Nm),0-60 mph 加速 3.3 秒;高性能版 Torcal S 为 875 hp(653 kW)、995 lb-ft(1350 Nm),0-60 mph 加速 2.8 秒,最高时速 162 mph(260 km/h),标准版为 155 mph(250 km/h)。新车基于大众集团内部与保时捷共享的技术平台,尺寸小于 Bentayga,定价预计低于该车型(至少低于…

推荐理由与 AI 无关的汽车发布,仅因信源被归入 AI 赛道而收录。

Ars Technica AI10 小时前模型政策监管海外

中美启动 AI 安全通报机制磋商,专家质疑美方诚意

中美本周就 AI 安全风险启动谈判,美国财长 Bessent 称双方已讨论建立新的 AI 安全通报机制,若中方参与,任一方发现本国 AI 系统出现威胁或异常行为时可向对方发出警报,该渠道还可用于沟通「共同目标」。但报道指出,中国可能不信任美方主导的安全对话:特朗普政府持续加码出口管制,国会还在审议进一步限制芯片与硬件出口的法案;两周前美国司法部还指控 6 家中国头部 AI 公司窃取美国前沿实验室技术,中方强烈否认。专家认为,特朗普的对华竞争叙事和「AI 竞赛」错觉可能反噬美国自身。

推荐理由中美 AI 安全对话首次出现具体机制,但同期出口管制和司法指控在加码,判断政策走向要看这组矛盾。

The Verge AI10 小时前模型产品发布/更新海外

微软更新 12 英寸 Surface Pro 和 13 英寸 Surface Laptop,搭载骁龙 X2 Plus

微软为 12 英寸 Surface Pro 和 13 英寸 Surface Laptop 换上高通骁龙 X2 Plus 芯片,10 月 13 日开售。12 英寸 Surface Pro 起售价从去年的 799.99 美元涨至 1149.99 美元,13 英寸 Surface Laptop 从 899.99 美元涨至 1199.99 美元,涨价部分源于取消 8GB 基础版,起步内存改为 16GB,最高可选 24GB。微软称六核骁龙 X2 Plus 的 NPU 本地 AI 推理性能提升最高 95%,图形性能提升超 60…

推荐理由本地 AI 推理提速 95%、起售价涨 350 美元,想买 Windows AI PC 的可以先看这份价格与续航账。

The Verge AI10 小时前模型产品发布/更新海外

微软新款 Surface Mouse 加入触觉反馈和 Copilot 快捷键

微软将于 10 月 13 日发布第二代 Surface Mouse,售价 79.99 美元,提供黑色和铂金两种配色。新款鼠标首次加入可自定义操作按钮,主要设计用于快速唤起 Copilot,也可通过 Surface 应用配置为其他快捷键。触觉反馈支持 Windows 11 中的点击、拖拽、窗口对齐等操作,并在 PowerPoint、Affinity、Concepts、Filmora 等应用中触发。鼠标采用软触感材质重新设计,支持蓝牙 6.0,可同时配对三台设备。该鼠标与新款 Surface Pro 12 英寸和 Su…

推荐理由79.99 美元买带触觉反馈和 Copilot 快捷键的鼠标,10 月 13 日开售,可配三台设备。

MarkTechPost10 小时前模型新模型发布海外

Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

Google 发布两款 Gemini Audio 系列语音模型:Gemini 3.8 Flash TTS 面向创意配音与角色设计,Flash-Lite TTS 面向高并发低成本生产,均通过 Gemini API 和 AI Studio 提供,仅 API 调用、不开源权重。新模型支持用自然语言逐句指导语气、节奏、方言,可从文本提示生成新音色,覆盖 100 多种语言和方言,并提供 2000+ 现成音色库。语音复刻需 30 秒样本和声音所有者口头同意录音,所有输出带 SynthID 水印。

推荐理由做配音、有声书或语音 Agent 的团队可直接换用,2000+ 音色库和逐句语气控制省去自建 TTS 的调参成本。

Ars Technica AI11 小时前模型产品发布/更新海外

YouTube 年内上线自定义信息流与多项 AI 功能

在年度 Made on YouTube 活动上,YouTube 宣布将推出 Custom Feeds 自定义信息流:用户输入描述即可生成新标签页,可细化描述并给推荐视频打分来调优,支持保存多个信息流,将先在美国上线网页、移动端和电视端。评论功能将支持发 GIF,可在普通视频和 Shorts 中使用;私信功能加入群聊,首批仅限美国、英国、新加坡、巴西和部分欧洲国家。活动还预告了面向观众和创作者的更多 AI 功能,但未给出具体细节。

推荐理由做内容分发或 YouTube 运营的可以提前规划自定义信息流带来的流量入口变化

X @OpenAI11 小时前模型论文研究海外

OpenAI 发布心理健康对话基准 MentalHealthBench

OpenAI 发布开放基准 MentalHealthBench,用于评估前沿模型在真实心理健康对话中的表现,并称模型在该场景持续改进。该基准由 80 多名心理健康临床医生参与构建,OpenAI 将其开源,供其他研究者检查方法、自行评测并在此基础上继续研究。

推荐理由做模型评测或心理健康 AI 的人可直接拿到这个含 80 多名临床医生输入的开放基准

OpenRouter 公告12 小时前模型新模型发布海外2 个独立信源

NVIDIA 开源 100M 参数说话人分离模型 Nemotron 3

NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,100M 参数,最多同时跟踪 8 位说话人,支持语音重叠场景,一个 checkpoint 同时覆盖离线录音与实时流式。权重采用 OpenMDW License 1.1,允许商用,通过 NVIDIA NeMo 在 Linux 上运行,支持 Ampere、Ada Lovelace、Hopper、Blackwell GPU。相比此前支持 4 人的 Streaming Sortformer,说话人上限翻倍。模型接收 …

推荐理由做会议转写、通话分析或语音 Agent 记忆的,可直接拿权重商用,8 人重叠场景有现成方案

The Decoder13 小时前模型产品发布/更新海外2 个独立信源

ChatGPT Voice 升级:接入邮件、日历和 Slack

ChatGPT Voice 迎来重大升级,全球可用,底层换成 OpenAI 新的 GPT-6 Astra、Sol 和 Luna 模型,并首次能调用邮件、日历、Slack 等插件。用户可直接用语音查日历、发邮件、让 ChatGPT 发现并取消财务应用里的重复扣款,甚至搭建带结账页的网站。语音功能也进入网页和移动端的 ChatGPT Work,说话即可生成文档、演示文稿和表格,最新版应用已上线。OpenAI 称这是迈向《Her》式日常 AI 助手的一步,但也承认伴随风险。

推荐理由语音现在能直接操作邮件、日历和 Slack,查日程、发邮件、搭网页都能一句话完成,已随最新版应用上线。

TechCrunch AI14 小时前模型产品发布/更新海外

ChatGPT 移动端上线语音 Agent 功能

OpenAI 宣布在移动端推出基于语音的 Agent 功能,用户可通过语音触发撰写文档、总结邮件等工作流。Plus 和 Pro 用户可在手机 Work 标签页中创建文档、起草邮件、总结 Slack 消息,还能建站、做演示、使用云端浏览器及访问财务等功能;Free 和 Go 用户可使用插件和已连接应用。ChatGPT 语音对话将提供更丰富的文本输出,用户可在文本与语音间切换,并支持移动端开始、桌面端继续。此前 7 月 OpenAI 推出对话模型 GPT-Live,并集成到桌面端 Work 和 Codex 标签页。

推荐理由Plus/Pro 用户现在能在手机上用语音直接建站、做 PPT、总结 Slack,移动办公场景可先试 Work 标签页。

Simon Willison14 小时前模型技巧与观点海外

Simon Willison 用 Fable 5.1 生成 Shadow DOM 交互教程

Simon Willison 发布了一个讲解 CSS shadow roots(影子 DOM)的交互式教程页面,通过可操作示例演示样式封装、继承、slots、parts 以及 JavaScript 访问等机制,展示 shadow root 如何创建带私有样式表的隔离 DOM 树。该页面由他向 Fable 5.1 Medium 输入提示词「构建一个用交互示例解释 CSS shadow roots 的作品」生成。原文未提供更多技术细节。

推荐理由想搞懂 shadow DOM 样式隔离和 slots 机制的前端开发者,可直接打开示例边点边学。

Google DeepMind15 小时前模型行业动态海外

Google 为云端 AI 加入加密持久记忆层

Google DeepMind 公布 Private AI Compute 架构更新,将在云端引入持久化记忆层,让 AI 助手跨设备保留上下文。数据存放在专用加密存储中,解密密钥仅保存在用户设备上,Google 也无法访问。请求时设备通过端到端加密通道连接云端安全隔区,在隔离内存中临时解密、处理并立即重新加密。此前该平台及业界同类方案均为无状态,任务结束即清除上下文,无法支撑连续的个人 AI 体验。

推荐理由云端 AI 记忆与端侧隐私如何兼得,这是目前最具体的架构方案,做 AI 助手和隐私合规的人可直接参考