Chinese CLIP:中文对比视觉语言预训练
Qwen 团队发布 Chinese CLIP,采用两阶段预训练方法将 CLIP 迁移到中文,使用 LAION-5B 中文部分、Wukong 等公开数据集,图文对总量达 2 亿。
推荐理由:原文给出两阶段预训练方法和跨模态检索对比结果,读者可据此了解中文 CLIP 的迁移路径与数据构成。
阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。
Qwen 团队发布 Chinese CLIP,采用两阶段预训练方法将 CLIP 迁移到中文,使用 LAION-5B 中文部分、Wukong 等公开数据集,图文对总量达 2 亿。
推荐理由:原文给出两阶段预训练方法和跨模态检索对比结果,读者可据此了解中文 CLIP 的迁移路径与数据构成。
Qwen 团队提出 OFA(One-For-All),一个统一理解与生成任务的统一多模态预训练模型,采用基于指令的多任务预训练,并开源了预训练和微调模型。OFA 统一了模态、架构和任务,用 VQ token 表示图像、用 bins 离散化边界框,预训练涵盖 8 个任务,包括视觉定位、图像描述、VQA、图文匹配、检测、图像补全和文本补全。
推荐理由:原文给出 OFA 的统一框架设计与 5 个尺寸的开源模型,读者可据此了解多模态统一模型的早期技术路线。