热点事件持续更新
llama.cpp 发布 b11372 版本
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026-10-03,llama.cpp 发布 b11372 版本。该版本针对 qwen4exp 的 lightning indexer 进行优化:将索引器分数内存减半,改为每个 head 单独计算并原地累加进单个 [n_pool, n_tokens] 分数张量。同时优化多后端支持:CUDA 新增支持 4 heads 的向量内核,Metal 将 head 数作为函数常量,Vulkan 按 keys×tokens 分块并改用 fp16 点积。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- llama.cpp Releasesllama.cpp b11372 发布:qwen4exp 索引器显存减半并优化多后端
llama.cpp 发布 b11372,qwen4exp 将 lightning indexer 的索引器分数内存减半,改为每个 head 单独计算并原地累加进单个 [n_pool, n_tokens] 分数张量。CUDA 新增支持 4 heads 的向量内核,Metal 将 head 数作为函数常量,Vulkan 按 keys×tokens 分块并改用 fp16 点积。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。