最近opencode go涨价,deepseek V4flash 0731涨价,半个月用完了额度,没事做,折腾本地部署,纯娱乐。本地大模型纯玩具,当然本地配置特别强的另说,前段时间用unsloth部署了腾讯的大模型unsloth/Hy-MT2-7B-GGUF,用来做网页翻译接入沉浸式翻译插件尚可,但是任务多了还是会出错,只能小额翻译任务使用。unsloth/gemma-4-12B-it-qat-GGUF也部署了,但是找不到用途,说本地编码吧,能力就一坨,对话暂时没什么需求。
昨天发现新玩具,低配置机器也能跑大模型,通过显存和内存混合使用实现。
伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。
FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。
论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。
FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
教程
1、访问freetoken的官方仓库或者官网下载软件,安装即可。
2、软件会自动识别本地机器环境,哪些能部署,哪些不能部署一目了然。
3、如果速度慢可以把MOE参数调低,上下文少可以把KV参数拉高

coinowo





