llama.cpp Releases· github-actions[bot]·· 1 天前AI 评分12
llama.cpp b11310 修复 CUDA iq4_nl 反量化短行越界问题
b11310
AI 导读
llama.cpp 发布 b11310,修复 CUDA 后端 iq4_nl 反量化行 kernel 在短行上的越界读写问题。dequantize_block_iq4_nl 每块写入 QK_K 个值,但 IQ4_NL 行只保证是 QK4_NL 的倍数,起始位置超出行长度的 32 值子块线程会读写越界,现改为跳过这些子块。
来源:llama.cpp Releases · github.com