我们通过 MentalHealthBench 展示前沿模型如何在真实的心理健康对话中持续改进。
这个新的开放基准测试汇集了 80 多位心理健康临床医生的意见。
我们将其公开,以便其他研究人员可以审查方法、运行自己的评估,并在此基础上继续推进。
https://t.co/VTm5ZgxJbl
原题:We’re demonstrating how frontier models have continued to improve in realistic mental health conversations with MentalHe…
OpenAI 发布开放基准 MentalHealthBench,用于评估前沿模型在真实心理健康对话中的表现,并称模型在该场景持续改进。该基准由 80 多名心理健康临床医生参与构建,OpenAI 将其开源,供其他研究者检查方法、自行评测并在此基础上继续研究。
推荐理由做模型评测或心理健康 AI 的人可直接拿到这个含 80 多名临床医生输入的开放基准
我们通过 MentalHealthBench 展示前沿模型如何在真实的心理健康对话中持续改进。
这个新的开放基准测试汇集了 80 多位心理健康临床医生的意见。
我们将其公开,以便其他研究人员可以审查方法、运行自己的评估,并在此基础上继续推进。
https://t.co/VTm5ZgxJbl
本文内容转载自 X @OpenAI,由 AI(deepseek-chat)翻译整理,版权归原作者所有。
阅读原文 ↗ https://x.com/OpenAI/status/2102837574092161102X @OpenAI · 09/24 03:08 · 热度 3511 · 已取全文
标题与摘要由 AI(deepseek-chat)改写,可能有误,以原文为准。