smevals:用于评测模型、提示词与评测框架的小型评测套件

来源:Simon Willison 博客 2026年7月31日 05:15 AIHOT 评分:73 精选
摘要:smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具,用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 `uvx smevals run` 对 gpt-5.5、claude-opus-4.6 等模型运行评测,并将运行与打分分离,最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。
# smevals:用于评测模型、提示词与评测框架的小型评测套件 - 来源:Simon Willison 博客 - 发布时间:2026-08-01 05:15 - AIHOT 分数:73 - AIHOT 标记:精选 - AIHOT 链接:https://aihot.virxact.com/items/cms9has920ey7ro9k5oh4ooow - 原文链接:https://simonwillison.net/2026/Jul/31/smevals ## 精选理由 一个轻量级评估框架,让编码代理帮你搭 eval,再直接跑模型对比。对想针对业务场景自建基准的团队,比通用榜单更实用。 ## AI 摘要 smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具,用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 `uvx smevals run` 对 gpt-5.5、claude-opus-4.6 等模型运行评测,并将运行与打分分离,最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。 ## 正文 这是一则列表来源,站内未收录完整正文。 > 站内仅提供摘要,全文见原文。