# smevals:用于评测模型、提示词与评测框架的小型评测套件
- 来源:Simon Willison 博客
- 发布时间:2026-08-01 05:15
- AIHOT 分数:73
- AIHOT 标记:精选
- AIHOT 链接:https://aihot.virxact.com/items/cms9has920ey7ro9k5oh4ooow
- 原文链接:https://simonwillison.net/2026/Jul/31/smevals
## 精选理由
一个轻量级评估框架,让编码代理帮你搭 eval,再直接跑模型对比。对想针对业务场景自建基准的团队,比通用榜单更实用。
## AI 摘要
smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具,用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 `uvx smevals run` 对 gpt-5.5、claude-opus-4.6 等模型运行评测,并将运行与打分分离,最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。
## 正文
这是一则列表来源,站内未收录完整正文。
> 站内仅提供摘要,全文见原文。