商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

来源:X:商汤 SenseTime (@SenseTime_AI) 2026年7月14日 08:38 AIHOT 评分:74 精选
摘要:商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。
# 商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型 - 来源:SenseTime (@SenseTime_AI) - 发布时间:2026-07-14 08:38 - AIHOT 分数:74 - AIHOT 标记:精选 - AIHOT 链接:https://aihot.virxact.com/items/cmrjy99kt01nvbiw22bwjsvnv - 原文链接:https://x.com/SenseTime_AI/status/2076828658531262619 ## 精选理由 商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。 ## AI 摘要 商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。 ## 正文 SenseNova-Vision-7B-MoT,现已完全开源:一个模型,覆盖以下所有主要视觉任务: 🔹检测 / OCR / GUI 🔹深度与法线 🔹分割 🔹多视图 它还能通过自然语言定义全新的视觉任务变体——跨越传统任务边界,重新组合视觉能力。 开源内容包括:模型权重 + SenseNova-Vision 语料库(含 5000 万样本子集,以及用于复现其余公开来源数据的完整工具包),供研究与开发使用。 🤗 HF:https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT 🔧GitHub:https://github.com/OpenSenseNova/SenseNova-Vision 💻 试用演示:https://huggingface.co/spaces/sensenova/SenseNova-Vision 📋技术报告:https://arxiv.org/abs/2607.06560 👾Discord:http://discord.gg/BuTXPHmQub