# 商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型
- 来源:SenseTime (@SenseTime_AI)
- 发布时间:2026-07-14 08:38
- AIHOT 分数:74
- AIHOT 标记:精选
- AIHOT 链接:https://aihot.virxact.com/items/cmrjy99kt01nvbiw22bwjsvnv
- 原文链接:https://x.com/SenseTime_AI/status/2076828658531262619
## 精选理由
商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。
## AI 摘要
商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。
## 正文
SenseNova-Vision-7B-MoT,现已完全开源:一个模型,覆盖以下所有主要视觉任务: 🔹检测 / OCR / GUI 🔹深度与法线 🔹分割 🔹多视图
它还能通过自然语言定义全新的视觉任务变体——跨越传统任务边界,重新组合视觉能力。
开源内容包括:模型权重 + SenseNova-Vision 语料库(含 5000 万样本子集,以及用于复现其余公开来源数据的完整工具包),供研究与开发使用。
🤗 HF:https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT 🔧GitHub:https://github.com/OpenSenseNova/SenseNova-Vision 💻 试用演示:https://huggingface.co/spaces/sensenova/SenseNova-Vision 📋技术报告:https://arxiv.org/abs/2607.06560 👾Discord:http://discord.gg/BuTXPHmQub