跳到正文
热点事件持续更新

llama.cpp 发布 b11372 版本

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026-10-03,llama.cpp 发布 b11372 版本。该版本针对 qwen4exp 的 lightning indexer 进行优化:将索引器分数内存减半,改为每个 head 单独计算并原地累加进单个 [n_pool, n_tokens] 分数张量。同时优化多后端支持:CUDA 新增支持 4 heads 的向量内核,Metal 将 head 数作为函数常量,Vulkan 按 keys×tokens 分块并改用 fp16 点积。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. llama.cpp Releases
    llama.cpp b11372 发布:qwen4exp 索引器显存减半并优化多后端

    llama.cpp 发布 b11372,qwen4exp 将 lightning indexer 的索引器分数内存减半,改为每个 head 单独计算并原地累加进单个 [n_pool, n_tokens] 分数张量。CUDA 新增支持 4 heads 的向量内核,Metal 将 head 数作为函数常量,Vulkan 按 keys×tokens 分块并改用 fp16 点积。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。