跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

130条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 121–130 条 · 共 130 条
6月6日周四
  1. Qwen Blog62

    原文发布 6月6日 11:59

    Qwen 团队用 Qwen-Agent 让 8k 上下文模型处理 1M token 文档

    Qwen 团队发布博客,介绍如何用 8k 上下文的 Qwen2 模型构建智能体来处理 1M token 的文档,效果超过 RAG 和原生长上下文模型。该智能体分三级:基于 BM25 关键词检索的 RAG、逐块阅读、以及将前两级封装为工具进行多跳推理的 ReAct 式智能体。

    推荐理由:原文给出用 8k 上下文模型处理 1M token 文档的三级智能体方案,可迁移到长文档问答场景。

4月25日周四
  1. Qwen Blog72

    原文发布 4月25日 13:33

    Qwen1.5-110B 发布:Qwen1.5 系列首个千亿参数级模型

    Qwen1.5 系列发布首个 100B+ 模型 Qwen1.5-110B,采用与同系列一致的 Transformer 解码器架构,包含分组查询注意力(GQA),支持 32K token 上下文和多语言。

    推荐理由:官方给出 Qwen1.5-110B 与 Llama-3-70B、Mixtral-8x22B 的基准对比,可据此判断百亿级开源模型的规模扩展收益。

4月16日周二
  1. Qwen Blog66

    原文发布 4月16日 13:33

    Qwen 发布开源代码模型 CodeQwen1.5-7B

    Qwen 团队发布 CodeQwen1.5-7B 与 CodeQwen1.5-7B-Chat,基于 Qwen1.5 预训练约 3 万亿代码相关 token,支持 92 种编程语言和 64K token 上下文。

    推荐理由:原文给出 CodeQwen1.5-7B 的预训练数据规模、上下文长度与多项基准对比,可据此判断开源代码模型与闭源模型的差距。

4月2日周二
  1. Qwen Blog71

    原文发布 4月2日 13:33

    Qwen1.5-32B 与 Qwen1.5-32B-Chat 发布

    Qwen 团队发布 Qwen1.5 系列新成员 Qwen1.5-32B 及其对话版本 Qwen1.5-32B-Chat,架构上引入 GQA 以提升推理效率。基础能力评测中,Qwen1.5-32B 在 MMLU 得 73.4、GSM8K 得 77.4、BBH 得 66.8,多数任务超过 Llama2-34B 和 Mixtral-8x7B,略低于 Qwen1.5-72B。

    推荐理由:原文给出 Qwen1.5-32B 与 72B、Llama2-34B、Mixtral-8x7B 的基准对比,读者可据此判断中等规模模型的取舍。

3月28日周四
2月4日周日
  1. Qwen Blog78

    原文发布 2月4日 13:33

    Qwen 团队开源 Qwen1.5 系列模型

    Qwen 团队发布 Qwen1.5 系列,开源 0.5B、1.8B、4B、7B、14B、32B、72B、110B 八种尺寸的 base 与 chat 模型,以及一个 MoE 模型,并提供 Int4、Int8 GPTQ 和 AWQ、GGUF 量化版本。

    推荐理由:原文给出六种尺寸的开源模型与量化版本,并列出与 transformers、vLLM 等框架的集成方式,便于开发者评估迁移成本。

1月25日周四
  1. Qwen Blog74

    原文发布 1月25日 13:33

    Qwen 发布 Qwen-VL-Plus 与 Qwen-VL-Max 两个升级版多模态模型

    Qwen 团队发布 Qwen-VL-Plus 和 Qwen-VL-Max 两个升级版视觉语言模型,在图像推理、细节识别与文字提取上均有提升,支持百万像素以上高清图和任意宽高比输入。

    推荐理由:官方给出 Qwen-VL-Plus 与 Max 的基准对比和开放入口,可据此判断多模态模型在中文图文任务上的位置。

1月23日周二
  1. Qwen Blog62

    原文发布 1月23日 22:13

    Qwen 发布开源语言模型系列介绍

    Qwen 团队在首次开源 Qwen-7B 四个月后,发布 Qwen 系列语言模型整体介绍,并开源 Qwen-1.8B、Qwen-7B、Qwen-14B 和 Qwen-72B 四个尺寸的模型。

    推荐理由:原文给出 Qwen 系列各尺寸模型的开源清单与上下文长度、工具调用等规格,便于读者对照选型。

12月24日周六
  1. Qwen Blog62

    原文发布 12月24日 14:54

    Chinese CLIP:中文对比视觉语言预训练

    Qwen 团队发布 Chinese CLIP,采用两阶段预训练方法将 CLIP 迁移到中文,使用 LAION-5B 中文部分、Wukong 等公开数据集,图文对总量达 2 亿。

    推荐理由:原文给出两阶段预训练方法和跨模态检索对比结果,读者可据此了解中文 CLIP 的迁移路径与数据构成。

11月14日周一
  1. Qwen Blog62

    原文发布 11月14日 16:01

    OFA:构建 One-For-All 统一多模态预训练模型

    Qwen 团队提出 OFA(One-For-All),一个统一理解与生成任务的统一多模态预训练模型,采用基于指令的多任务预训练,并开源了预训练和微调模型。OFA 统一了模态、架构和任务,用 VQ token 表示图像、用 bins 离散化边界框,预训练涵盖 8 个任务,包括视觉定位、图像描述、VQA、图文匹配、检测、图像补全和文本补全。

    推荐理由:原文给出 OFA 的统一框架设计与 5 个尺寸的开源模型,读者可据此了解多模态统一模型的早期技术路线。