NEO-unify:原生架構打造端到端多模態理解與天生統一模型
当前多模態智能架構困境
長期以來,多模態钻研已形成一種默認範式:視覺編碼器(Vision Encoder, VE) 负責感知與理解,而變分自編碼器(Variational Autoencoder, VAE) 则用於內容天生。近期的一些工作尝試構建共享編碼器,但這種折衷往往引入新的結構性設計權衡。
由此回到第一性道理:構建一體化模型直接處理原生输入,即像素自身與文字自身。商湯科技聯合南洋理工大學,提出一種全新的架構範式:NEO-unify(preview),一個原生、統一、端到端的多模態模型架構。它不僅越過了当前視覺表征的爭论,也脱节了预训练先驗和規模定律瓶颈的限度。最關鍵的是:不必要 VE,也不必要 VAE。
我們正扩大規模、持續迭代。更多模型與開源成就,將很快與各人見面。
NEO-unify原生一體化架構新範式
NEO-unify 第一次迈向真正的端到端統一框架,可能直接從近乎無損的資訊输入中學習,并由模型自身塑造內部表征空間。首先,引入近似無損的視覺接口,用於統一圖像的输入與输出暗示;其次,选取原生混合Transformer(Mixture-of-Transformer,MoT)架構,使理解與天生可能在统一體系中協同進行;最終,通過統一學習框架實現跨模態训练:文本选取自回归交叉熵目標,視覺通過像素流匹配進行優化。
模型成效
1、定量結果分析


2、生圖成效展示


技術發現
1、無編碼器設計可能同時保留抽象語義與细粒度表征
[圖像沉建任務]
我們先前的工作 NEO(Diao et al., ICLR 2026)批注,原生端到端模型同樣可能學習到豐富的語義表征。在此基礎上,我們進一步觀察到一個有趣的現象:即便在冻結理解分支的情况下,獨立的天生分支依然可能從暗示中抽取并复原细粒度的視覺细節。
基於這一發現,我們训练了 NEO-unify(2B)。在初步 9 萬步预训练後,模型在 MS COCO 2017 上获得 31.56 PSNR 和 0.85 SSIM,而 Flux VAE 的對應指標為 32.65 和 0.91。這一結果批注,即便不依赖预训练 VE 或 VAE,近似無損的原生输入仍可能同時支持高質量的語義理解與像素級细節保真。
域表圖像沉建(2B NEO-unify,理解分支冻結)

[圖像編輯任務]
據此,我們進一步開展索求:NEO-unify 將所有全模態條件資訊統一输入到理解分支,而天生分支僅负責天生新的圖像。
即便在冻結理解分支的情况下,NEO-unify(2B) 仍展現出強大的圖像編輯能力,同時顯著削减了输入圖像令牌的數量。在使用開源天生與圖像編輯數據集并進行初步 6 萬步混合训练後,模型在 ImgEdit 基準上获得 3.32 的成績,且理解分支在整個训练過程中维持冻結。
幼規模數據驗證(2B NEO-unify,理解分支冻結)

ImgEdit提醒词編輯(2B NEO-unify,理解分支冻結)

2、無編碼器架構與 MoT 主干高度協同大幅降低內在矛盾
借助预训练的理解分支與天生分支,NEO-unify 使用一样的中期训练(MT)與 监督微調(SFT) 數據進行聯合训练。即便在較低的數據比例和損失權沉下,理解能力依然维持穩定,而天生能力则收敛很快。二者在 MoT 主干中協同提升,整體矛盾極幼。

3、無編碼器架構,展現更高數據训练效能
此表,我們首先進行 web-scale 预训练,隨後在多樣且高質量的數據語料上顺次進行中期训练(MT) 和 监督微調(SFT)。與 Bagel 模型相比,NEO-unify 展現出更高的數據训练效能,在使用更少训练 token 的情况下获得了更優的机能。

未來瞻望
這不僅僅是一種模型架構索求,更是迈向下一代智能形態的一步:
? 感知與天生交错的閉環
? 全模態推理
? 視覺推理
? 空間智能
? 世界模型
? …
一條新的路線圖在展開:模型不再在模態之間進薪―換,而是可能原生地跨模態思虑。多模態 AI 不再只是連接分歧系統,而是構建一個從未割裂的統一智能體,并讓所需能力從其內部天然涌現。