跳到正文
原文
llama.cpp Releases· github-actions[bot]·· 3 小时前AI 评分20

llama.cpp b11331 发布:CUDA 后端支持 NVFP4 计算类型

b11331

AI 导读

llama.cpp 发布 b11331,在 CUDA 的 cuBLAS 路径上为 NVFP4 量化模型处理计算类型,硬件允许时使用 BF16 计算类型,并将 NVFP4 的累加精度设为 bf16 以满足其最低精度范围要求。该改动同时保留 per-expert matmul 的 op_params。

来源:llama.cpp Releases · github.com