AI 日报

AI 日报 2026年7月25日

  • Anthropic 发布 Claude Opus 5

    Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。

    来源:Anthropic:Newsroom(网页)
  • 蚂蚁百灵发布Ling-3.0-flash原生混合推理模型

    蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-flash,总参数量124B,激活参数量仅5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰Ring-2.6-1T。模型采用原生混合线性注意力架构与1/64稀疏MoE,并扩展至10,000+可交互训练环境,长输入下TTFT降低60%至80%以上。

    来源:公众号:蚂蚁百灵(Ling)
  • FLUX 3 x mimic:新一代视频动作模型

    Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。

    来源:Hacker News 热门(buzzing.cc 中文翻译)
  • Midjourney V8.2 发布:专注美学提升与个性化理解

    Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。

    来源:Midjourney:Updates(RSS)
  • Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频

    Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。

    来源:IT之家(RSS)
  • Runway Agent 推出自然语言工作流功能

    在 Runway Agent 中引入工作流。现在你可以通过自然语言构建、运行或编辑基于节点的工作流。工作流可大规模解锁高质量输出。 立即尝试,点击下方链接调用 / Workflow 技能。

    来源:X:Runway (@runwayml)
  • 百度搭子更新:电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行

    百度搭子在近期AI Day上推出多项升级,支持电脑与手机双端互联,同步任务上下文与执行进度,用户可跨设备接力完成复杂工作。桌面端内嵌浏览器正式上线,能自动打开多个网页执行调研、下载等操作,手机端支持云端远程操控。智能路由自动匹配任务模式,平均任务耗时降低20%,Token利用率提升25%;简单任务完成度达100%,复杂任务高交付率94%,积分消耗最高降低75%。

    来源:公众号:百度智能云(文心)
  • OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属

    OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。

    来源:OpenRouter:Announcements(RSS)
  • Claude Code v2.1.219 发布:新增 Claude Opus 5,支持 1M 上下文与嵌套子智能体

    Claude Code v2.1.219 新增 Claude Opus 5 作为默认 Opus 模型,支持 1M 上下文窗口,快速模式定价为 $10/$50 每百万 token。

    来源:Claude Code:GitHub Releases(RSS)
  • Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

    Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

    来源:Anthropic:Research(发表成果 · 网页)
  • Apple 提出 LEAD 方法,破解长程推理中的“不可恢复瓶颈”

    Apple 研究发现,大语言模型在长程执行中即使有高层策略也不稳定,极端分解会导致“不可恢复瓶颈”——少数“困难”步骤上的持续错误变得不可逆转。为此提出 Lookahead-Enhanced Atomic Decomposition(LEAD),通过引入短程未来验证与聚合来打破这一瓶颈。该方法在受控算法谜题上验证了有效性。

    来源:Apple Machine Learning Research(RSS)
  • Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用

    Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。

    来源:Hacker News 热门(buzzing.cc 中文翻译)
  • Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80%

    Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。

    来源:Claude:Blog(网页)
  • Claude Design 产品设计师 Nate Parrott 分享如何用其探索视觉创意

    Anthropic 产品设计师 Nate Parrott 分享了他在 Claude Design(beta 版)中利用 HTML 交互能力进行产品原型、幻灯片、动画等视觉创意探索与迭代的方法。他将 Anthropic 品牌规范提炼为提示词,使输出自动符合品牌指南。Claude Design 不包含图像模型,不适合 Logo 设计,但可与 Claude Code 协同工作,将早期创意与生产开发衔接。

    来源:Claude:Blog(网页)
  • Claude 模型家族详解:如何为工作负载选择最佳模型

    Anthropic 发布 Claude 模型选择指南,将模型分为 Mythos/Fable(最强能力,用于前沿编码与智能体任务)、Opus(推理密集型企业任务)、Sonnet(日常通用任务)和 Haiku(最低成本与最快速度)四个类别。

    来源:Claude:Blog(网页)