Exa Semantic Discovery· CCTest·AI 评分41
HUST Vision Lab 提出 Multimodal Flow:用连续流统一语言与视觉
Multimodal Flow Unifies Language and Vision with Continuous Flow - CCTest
AI 导读
HUST Vision Lab 提出 Multimodal Flow,将文本与图像作为连续多模态表示在共享 Flow Matching 骨干中统一建模,并实例化为 MF-1,预训练规模为 0.6B、1.2B、1.6B。
来源:Exa Semantic Discovery · cctest.ai