跳到正文
llama.cpp Releases· github-actions[bot]·· 3 小时前AI 评分22

llama.cpp b11518 为 Metal 后端新增 128/96 flash attention kernel

b11518

AI 导读

llama.cpp 发布 b11518 版本,为 Metal 后端新增 128/96 flash attention kernel,并支持接受所有已编译的 kernel 组合。该版本同时更新了 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台构建产物。

来源:llama.cpp Releases · github.com