首页
学习
活动
专区
圈层
工具
发布

llama.cpp Metal 优化:苹果芯片上 IQ3_XXS 解码提速

我搞了个 llama.cpp 的 Metal 优化,在苹果芯片上跑 IQ3_XXS 模型的时候,解码速度提升还挺明显的。

我自己的测试里,用 tiel coder 35B A3B 这个模型,解码速度大概从 65.6 tok/s 提到了 73.9 tok/s。

要是你们方便的话,可以试试看,顺便把前后的速度数据发出来对比一下。

另外我还有个后续优化正在弄,下来应该还能把 prefill 的速度也提一提。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OZsh9v-W83iBYKbTU_Y7_A5A0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券