你的位置:开云集团「中国」Kaiyun·官方网站 > 新闻 >

开云体育在通用视觉 - 言语理奉命务中-开云集团「中国」Kaiyun·官方网站

  • 发布日期:2026-10-09 08:23    点击次数:97
  • 开云体育在通用视觉 - 言语理奉命务中-开云集团「中国」Kaiyun·官方网站

    跟着多模态大模子(MLLMs)在种种视觉言语任务中展现出刚劲的雄厚与交互才调,如何高效地处理原生高分辨率图像以捕捉邃密的视觉信息,已成为升迁模子性能的关键标的。

    关联词,主流的视觉编码范式往往难以兼顾性能与恶果:基于切片的编码设施虽能缩短蓄意支拨,却糟跶了全局高下文感知才调;而全局原陌生辨率编码在升迁合座性能的同期,又带来了宏大的蓄意职责。同期,现存的视觉压缩计谋与特征索求过程相对孤苦,难以在编码早期灵验为止信息冗余,短少一个兼顾细粒度建模与蓄意恶果的调和架构。

    针对如安在高清原陌生辨率下,保捏图像全局雄厚才调的同期,还能快速推理这一中枢问题,来自清华大学、中科院的参议团队谨慎发布 LLaVA-UHD v3!

    张开剩余85% 论文标题:LLAVA-UHD V3: PROGRESSIVE VISUAL COMPRESSION FOR EFFICIENT NATIVE-RESOLUTION ENCODING IN MLLMS 论文伙同:https://arxiv.org/abs/2511.21150 代码伙同:https://github.com/thunlp/LLaVA-UHD huggingface 伙同:https://huggingface.co/Sishxo/LLaVA-UHD-v3

    LLaVA-UHD-v3 提议了全新的渐进式视觉压缩框架 ——Progressive Visual Compression(PVC),由 Refined Patch Embedding(RPE) 与 Windowed Token Compression(WTC) 两个中枢组件组成。该框架在保捏全局语义一致性的前提下,权臣减少视觉 Token 数目,从根底上升迁原生高分辨率视觉编码的恶果。依托 PVC,LLaVA-UHD-v3 在性能上可与 Qwen2-VL 相比好意思,同期竣事 1.9× 的 TTFT 加快,好意思满进修仅需 32 张 A100、约 300 小时即可完成。

    切片编码 vs 全图编码长远分析

    为了自制对比两种主流视觉编码样貌 —— 基于切片的编码 (Slice-based Encoding, SBE) 与 全局原陌生辨率编码 (Global Native-Resolution Encoding, GNE) —— 团队使用调换模子架构 + 调换进修数据 + 调换评估 protocol。在此基础上,既在通用多模态 benchmark 上测试,也成心构建了一个合成数据集 ShapeGrid 用于空间感知 / 定位才调分析。

    在 ShapeGrid (偏激 “Sudoku-style” 子集) 上,GNE 比拟 SBE 在空间感知 / 定位任务上的施展存显着上风:空间感知才调平均升迁约 11.0%。

    同期,在通用视觉 - 言语理奉命务中,GNE 在语义雄厚施展上也略优于 SBE(平均升迁约 2.1%)。

    更首要的是,通过对比注观念热图、激活散播 (attention maps),参议发现 SBE 在空间定位任务中施展出系统性的标的、结构偏差 (举例水平、垂直标的不平衡) —— 也等于说 SBE 的切片机制烦懑了图像的空间一语气性 (spatial continuity 、geometry),从而大概了空间雄厚、定位的可靠性。

    因此,该对比实验分解地标明:尽管 SBE 在恶果上有上风,但从语义 + 空间 + 几何一致性 (global context + spatial reasoning) 的角度,GNE 显着更符合需要空间感知、高分辨率雄厚与推理的任务。

    全图编码的高效惩办决议

    全局原陌生辨率编码带来了较高的蓄意老本,这突显了紧迫需要一种原生且高效的视觉编码范式。因此,团队提议了 LLaVA-UHD v3,一种配备了渐进式视觉压缩(PVC)设施的多模态大模子(MLLM),用于高效的原陌生辨率编码。

    PVC 架构由两个中枢模块组成:

    邃密化 Patch 镶嵌 (Refined Patch Embedding, RPE):通过将图像区分为更小尺寸的 patch,并用伪逆 (pseudo-inverse) 设施将预进修模子原有 embedding 权重调养为新的、更细粒度的 embedding。这么,本来粗粒度 patch 的语义信息被类似保留,但竣事了更丰富的视觉语义索求建模。 窗口化 Token 压缩 (Windowed Token Compression, WTC):在 ViT 的中间层,将空间上相邻的多个 token(举例 2×2 区域)团员为一个新 token,初期以均匀平均池化 (average pooling) 起步,并通过一个轻量级、零启动化的 MLP 模子学习施行自得当的池化权重,从而渐渐学会对更首要区域赋予更高权重。这么,跟着收集深度的鞭策,token 数目被大幅压缩,而关键语义信息得以保留。

    这种 “先细粒度建模 + 再渐进压缩” 的设想,使得 PVC 在兼顾全局语义 + 局部细节的同期,大幅缩短蓄意量。

    实验考据:PVC 在推理恶果升迁的同期保留模子才调

    恶果方面,在调和的 LLM(Qwen2-7B)框架下,本文提议的 ViT-UHD 编码器比拟 MoonViT 竣事了 2.4× 加快,比拟 Qwen2.5-ViT 也快 1.9×。将其整合到好意思满的 MLLM 中后,LLaVA-UHD v3 的 TTFT 相较刚劲的 Qwen2-VL 缩短 49%(约快 1.9×),致使比以高效著称的切片编码模子 MiniCPM-V2.6 仍然快约 10%。

    在性能方面,LLaVA-UHD v3 仅使用约 2000 万对图文数据完成进修,远低于 Qwen2-VL(约 7 亿)和 MiniCPM-V-2.6(约 4.6 亿)等交易模子的进修范围。关联词,其在多项视觉言语基准中依旧展现出高度竞争力。同期,它竣事了 64× 的视觉 Token 压缩率,远超敌手(Qwen2-VL 约为 4×,MiniCPM-V2.6 为 16×),但在需要细粒度视觉信息的任务上 —— 包括 HallusionBench(幻觉检测)、CV-Bench(空间推理)以及 OCR&Chart(翰墨与图表识别)—— 已经赢得了与 SOTA 模子卓绝致使更优的施展。

    这些完结充分考据了 PVC 框架的中枢价值:在大幅减少视觉 Token 和推理支拨的同期,仍能稳健保留关键的细节感知与全局雄厚才调,竣事确凿真谛真谛上的 “高效而不左迁”。

    预测

    基于对全图编码与切片编码优劣的长远分析,LLaVA-UHD v3 提议了连合两者上风的渐进式视觉压缩全图编码决议,在保证模子才调的前提下竣事了权臣的推理恶果升迁,并展现出考究的挪动与泛化才调,为 MLLM 的高精度原陌生辨率建模提供了可行旅途。

    不外,实验分析标明,缺失了预对都阶段的 ViT-UHD 性能欠安,这标明引入 PVC 后的视觉编码器才调仍未达到上限:仅靠面前 MLLM 的圭表进修经由,很难都备挖掘 ViT 的视觉表征后劲,其学风气未蹂躏。此外,跟着 Token 数目增大,Transformer 的二次复杂度仍然会带来老本瓶颈。

    将来开云体育,仍需要探索更符合多模态任务的视觉编码预进修计谋,并郑重引入线性复杂度算子替代传统的二次复杂度注观念机制,从而竣事确凿可扩张的高效多模态建模。

    发布于:河北省