我搞了个 llama.cpp 的 Metal 优化,在苹果芯片上跑 IQ3_XXS 模型的时候,解码速度提升还挺明显的。
我自己的测试里,用 tiel coder 35B A3B 这个模型,解码速度大概从 65.6 tok/s 提到了 73.9 tok/s。
要是你们方便的话,可以试试看,顺便把前后的速度数据发出来对比一下。
另外我还有个后续优化正在弄,下来应该还能把 prefill 的速度也提一提。
分享快讯到朋友圈