llama.cpp Releases· github-actions[bot]·· 3 小时前AI 评分20
llama.cpp b11331 发布:CUDA 后端支持 NVFP4 计算类型
b11331
AI 导读
llama.cpp 发布 b11331,在 CUDA 的 cuBLAS 路径上为 NVFP4 量化模型处理计算类型,硬件允许时使用 BF16 计算类型,并将 NVFP4 的累加精度设为 bf16 以满足其最低精度范围要求。该改动同时保留 per-expert matmul 的 op_params。
来源:llama.cpp Releases · github.com