OpenRouter 推出 Batch API,批量推理可享半价

来源:OpenRouter:Announcements(RSS) 2026年9月22日 08:00 AIHOT 评分:70 精选
摘要:OpenRouter 发布 Batch API,异步批量请求由供应商在 24 小时窗口内完成,通常按正常 per-token 价格的 50% 或更低收费,目前已支持 70 多个模型。
# OpenRouter 推出 Batch API,批量推理可享半价 - 来源:OpenRouter:Announcements(RSS) - 作者:Brian Thomas - 发布时间:2026-09-22 08:00 - AIHOT 分数:70 - AIHOT 标记:精选 - AIHOT 链接:https://aihot.news/items/cmucobbcz0hj4roedra9qgdbh - 原文链接:https://openrouter.ai/blog/announcements/batch-api ## 精选理由 公告给出折扣幅度、70+ 模型覆盖和 beta 期 230k+ 批次的实测完成时间,还提示了提交时段对速度的影响。 ## AI 摘要 OpenRouter 发布 Batch API,异步批量请求由供应商在 24 小时窗口内完成,通常按正常 per-token 价格的 50% 或更低收费,目前已支持 70 多个模型。 ## 正文 对于大批量的工作或无需立即完成的请求,你现在可以使用新的 batch API。提交批次时,提供商可以在 24 小时窗口内自行选择完成请求的时间,作为交换,他们通常收取正常每 token 价格的 50%(有时更低)。 它目前已在 超过 70 个模型上可用。请在 Batch API 文档中了解如何使用它。 在实践中,我们观察到你很少需要等待接近 24 小时。在我们为期两周的 beta 期间完成的 230k+ 个批次中,中位数在 7 分钟内完成,90% 在一小时内完成。 Batch 是一种异步 API,适用于你可以接受高度可变响应时间的工作负载,例如为语料库打标签、回填嵌入向量、为评测集打分、汇总积压的工单,或在夜间对几千行数据运行相同的提示词。 Batch API 的工作原理 调用 api/v1/batches,传入你的请求列表,并指定要使用的端点形态。Chat completions、responses、messages 和 embeddings 均受支持。例如: curl https://openrouter.ai/api/v1/batches \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ -d '{ "endpoint": "/v1/chat/completions", "model": "google/gemini-3.8-flash", "requests": [ { "custom_id": "ticket-0001", "body": { "messages": [{ "role": "user", "content": "Summarize this ticket in one sentence." }] } }, { "custom_id": "ticket-0002", "body": { "messages": [{ "role": "user", "content": "Summarize this ticket in one sentence." }] } } ] }' 发出请求后,开始轮询 GET /api/v1/batches/:id,直到状态为 completed、failed、expired 或 cancelled。已完成的批次会在同一响应中内联返回其结果。 大多数批次几分钟内即可完成 我们查看了两周测试期内完成的批次,并测量了从接受到返回结果的时间。中位数为 7 分钟,第 90 百分位为 1.0 小时,第 99 百分位为 10.3 小时。我们还发现,提交的时间点比发送的请求数量影响更大。 在太平洋时间凌晨 5 点到中午之间提交的批次,明显比其他时段更慢。最慢的十分之一需要 2 到 4.5 小时。在其他任何时段提交,第 90 百分位都会降到 1.1 小时以下,而在太平洋时间下午 6 点之后则低于 50 分钟。 单个请求的批次根据时段不同,完成时间为 5 到 11 分钟,而包含 1,000 个或更多请求的批次完成时间为 12 到 21 分钟。大批次处理确实需要更长时间。在太平洋时间午夜到中午之间提交的、请求数超过 100 的批次中,最慢的十分之一耗时长达 6.8 小时。 批次支持哪些功能 请求形态:你已发送给 OpenRouter 的任何文本请求体形态都将得到支持,包括 chat completions、responses、messages 和 embeddings。 路由:每个批次在单一提供商上执行。默认情况下,在应用你的提供商允许列表、数据政策和 BYOK 设置之后,我们会为该模型选择最便宜的批次端点。 BYOK:配置了提供商密钥后,在支持该功能的提供商上的批处理会通过你的密钥路由,你只需支付 BYOK 费用。 逐请求结果:每个结果独立返回,因此少数几行出错绝不会导致整个任务失败。 保留期限:输入和结果会保留 30 天,或直到你DELETE该批次。 日志记录:每个批次都会显示在日志的 Batches 标签页中,包含模型、提供商、状态和费用。 定价:折扣适用于按 token 计费的价格,并因模型而异。网络搜索调用按标准费率计费。 输入:图像和文件必须是公开 URL。音频、视频以及 OpenRouter 自有的网络搜索插件在批处理中不可用(参见文档中的限制部分)。 选择一个支持批处理的模型,获取一个API 密钥,然后将你的第一个批次提交到https://openrouter.ai/api/v1/batches。快速入门中有完整的请求和响应结构。 在 Discord 的#feedback中告诉我们你在批处理什么。