ARTICLE · 人工智能

小红书“问一问”多模态推理加速实践:让视觉 Token 更精简、MoE 专家更聚焦

作者:小红书技术REDtech 来源:小红书技术REDtech 2026-08-05 17:59 22 分钟 12 阅读 5269 字
AI 推理多模态模型Vision Token 压缩MoE 专家重路由大模型加速
一语总结

本文通过 Vision Token 动态压缩与 SERE 专家重路由两项技术,实现多模态推理的 Prefill 与 Decode 双端加速,TTFT 降 13%,TPOT 降 16.5%。

AI 总结

文章详细介绍了小红书“问一问”多模态大模型推理的两大瓶颈:视觉 Token 膨胀导致 Prefill 计算压力增大,MoE 专家激活在 Decode 阶段随 batch 增大导致权重搬运开销。针对前者,提出 VisionZip 算法,基于 attention 分数动态裁剪冗余视觉 Token,并在多图请求中实现全局 token 预算竞争,保持 OCR、表格等高信息密度图片的细节。针对后者,推出 SERE(Similarity‑based Expert Re‑routing),在 Decode 阶段利用专家相似性进行批内重路由并保护关键专家,显著降低激活专家数。工程上将两项方案集成到 vLLM,使用 Triton 与 CUDA Kernel 实现高效算子,并保持 PD 分离部署不变。实验在 Qwen3‑VL‑32B、Qwen3‑30B‑A3B 等模型上验证,VisionZip 裁剪 40% Token 使 TTFT 从 687 ms 降至 601 ms(‑13%),SERE K=2 将 TPOT 从 44.4 ms 降至 32.8 ms(‑26%),业务多图负载 TPOT 下降 16.5%,且综合效果基本持平。文章还分析了压缩率对细粒度任务的影响并提供 Bad Case 修复方案,展望了动态压缩与重路由的进一步优化方向。

核心要点
  1. 视觉 Token 冗余是多图场景的主要瓶颈。

    VisionZip 通过 attention 评分动态裁剪冗余 Token,统一预算竞争,使高信息密度图片保留更多 Token,显著缩短 Prefill 序列长度。

  2. MoE 专家激活在 Decode 阶段随 batch 增大导致权重搬运开销。

    SERE 基于专家相似性进行批内重路由,并通过关键专家保护避免能力退化,实现显著的 TPOT 降低。

  3. 双端优化在实际业务中取得可观加速且效果基本持平。

    在 Qwen3‑VL‑32B 上裁剪 40% Token TTFT 降 13%;SERE K=2 在公开模型上 TPOT 降 26%;业务负载 TPOT 降 16.5%,综合指标与基线持平。

  4. 工程实现保持 PD 分离部署不变,兼容多模型。

    在 vLLM 中集成 VisionZip 与 SERE,使用 Triton 与单 CUDA Kernel 完成注意力归约、专家重路由和关键专家保护,避免额外 Python‑CUDA 往返。

  5. 针对细粒度任务提供压缩率调节与 Bad Case 修复方案。

    在 OCR、表格等信息密集场景采用更保守的压缩率,并通过关键专家保护矩阵恢复因重路由导致的细节回归。

小红书“问一问”多模态推理加速实践:让视觉 Token 更精简、MoE 专家更聚焦

文章详细介绍了小红书“问一问”多模态大模型推理的两大瓶颈:视觉 Token 膨胀导致 Prefill 计算压力增大,MoE 专家激活在 Decode 阶段随 batch 增大导致权重搬运开销。针对前者,提出 VisionZip 算法,基于 attention 分数动态裁剪冗余视觉 Token,并在多图请求中实现全局 token 预算竞争,保持 OCR、表格等高信息密度图片的细节。针对后者,推出 SERE(Similarity‑based Expert Re‑routing),在 Decode 阶段利用专家相似性进行批内重路由并保护关键专家,显著降低激活专家数。工程上将两项方案集成到 vLLM,使用 Triton 与 CUDA Kernel 实现高效算子,并保持 PD 分离部署不变。实验在 Qwen3‑VL‑32B、Qwen3‑30B‑A3B 等模型上验证,VisionZip 裁剪 40% Token 使 TTFT 从 687 ms 降至 601 ms(‑13%),SERE K=2 将 TPOT 从 44.4 ms 降至 32.8 ms(‑26%),业务多图负载 TPOT 下降 16.5%,且综合效果基本持平。文章还分析了压缩率对细粒度任务的影响并提供 Bad Case 修复方案,展望了动态压缩与重路由的进一步优化方向。

文章金句

"

VisionZip 的核心观察是:视觉编码器深层特征中,少量 dominant tokens 已经聚合了主要图像信息。

"

SERE(Similarity‑based Expert Re‑routing)不改模型权重、不重新训练,而是在 Decode 阶段按层、按 batch 动态重排专家路由。

"

在 Qwen3‑VL‑32B 的 30 图样本上,裁剪 40% vision tokens 时,TTFT 从 687 ms 降至 601 ms,下降 13%。

"

SERE K=2(ρ=0.5)达到 80.37,保留 97.7% 的原始效果,同时 TPOT 从 44.40 ms 降至 32.82 ms。