跳到正文
原文
Exa Semantic Discovery· CCTest·AI 评分41

HUST Vision Lab 提出 Multimodal Flow:用连续流统一语言与视觉

Multimodal Flow Unifies Language and Vision with Continuous Flow - CCTest

AI 导读

HUST Vision Lab 提出 Multimodal Flow,将文本与图像作为连续多模态表示在共享 Flow Matching 骨干中统一建模,并实例化为 MF-1,预训练规模为 0.6B、1.2B、1.6B。

来源:Exa Semantic Discovery · cctest.ai