OpenAI 发布 GPT-5.6 系列医疗评估结果

来源:X:Sam Altman (@sama) 2026年7月11日 00:46 AIHOT 评分:68 精选
摘要:OpenAI 发布 GPT-5.6 系列在医疗领域的评估结果。最小变体 GPT-5.6 Luna 在最低推理强度下即超越最高推理强度的 GPT-5.5,且成本低 25 倍;最大变体 GPT-5.6 Sol 树立新标杆。在涵盖患者端与临床端的多样化任务中,专科医生被要求以无限时间和网络访问权限撰写回答,随后由其他医生盲评。评估基于准确性、沟通、完整性、指令遵循及健康决策帮助性五个维度,共 20000 次评分。结果显示,所有 GPT-5.6 模型表现均显著优于医生,且医生发现 GPT-5.6 回答中的缺陷少于医生自己撰写的回答。
# OpenAI 发布 GPT-5.6 系列医疗评估结果 - 来源:Sam Altman (@sama) - 发布时间:2026-07-12 00:46 - AIHOT 分数:68 - AIHOT 标记:精选 - AIHOT 链接:https://aihot.virxact.com/items/cmrglvcki024uih2edvsk7pef - 原文链接:https://x.com/sama/status/2075985056846451123 ## 精选理由 GPT-5.6 在医疗任务上被医生评价比真人医生缺陷更少, 这是AI辅助诊断的分水岭, 产品人和医疗从业者值得看具体数据。 ## AI 摘要 OpenAI 发布 GPT-5.6 系列在医疗领域的评估结果。最小变体 GPT-5.6 Luna 在最低推理强度下即超越最高推理强度的 GPT-5.5,且成本低 25 倍;最大变体 GPT-5.6 Sol 树立新标杆。在涵盖患者端与临床端的多样化任务中,专科医生被要求以无限时间和网络访问权限撰写回答,随后由其他医生盲评。评估基于准确性、沟通、完整性、指令遵循及健康决策帮助性五个维度,共 20000 次评分。结果显示,所有 GPT-5.6 模型表现均显著优于医生,且医生发现 GPT-5.6 回答中的缺陷少于医生自己撰写的回答。 ## 正文 "医生发现,GPT-5.6 的回答中存在的缺陷少于医生自己撰写的回答。" ### 引用推文 > Karan Singhal:♥️ GPT-5.6 在健康领域迈出了重要一步,无论是在前沿性能还是成本方面。 这些模型推动了每美元性能的边界,将最优秀的健康智能带给所有人。最小的变体 GPT-5.6 Luna,在最低推理努力下进行评估,其表现超过了最高推理努力下的 GPT-5.5--尽管成本低了 25 倍。最大的变体 GPT-5.6 Sol,则在成...