欢迎光临
我们一直在努力

笔记本40708G显卡和32GB内存部署本地大模型QWEN3.6 35b

最近opencode go涨价,deepseek V4flash 0731涨价,半个月用完了额度,没事做,折腾本地部署,纯娱乐。本地大模型纯玩具,当然本地配置特别强的另说,前段时间用unsloth部署了腾讯的大模型unsloth/Hy-MT2-7B-GGUF,用来做网页翻译接入沉浸式翻译插件尚可,但是任务多了还是会出错,只能小额翻译任务使用。unsloth/gemma-4-12B-it-qat-GGUF也部署了,但是找不到用途,说本地编码吧,能力就一坨,对话暂时没什么需求。

昨天发现新玩具,低配置机器也能跑大模型,通过显存和内存混合使用实现。

FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s

伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。

FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。

论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。

FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。

我本地笔记本4070显卡、32GB的内存,跑了一下qwen 3.6 35b的模型,速度在16-20t/s,编码能力不太行,对话能将就用,让模型跑了一下秦始皇骑北极熊,只能说结果勉勉强强,比我在unsloth跑的qwen 3.8 27b出的摄像头好的多。
本地部署大模型难不难?一点不难,通过第三方直接点击就能运行,不需要自己去跑命令。
如果是租用GPU来跑deepseek V4 FLASH成本可以降很多了,可以去vast看看。

教程

1、访问freetoken的官方仓库或者官网下载软件,安装即可。

2、软件会自动识别本地机器环境,哪些能部署,哪些不能部署一目了然。

3、如果速度慢可以把MOE参数调低,上下文少可以把KV参数拉高

赞(0)
未经允许不得转载:coinowo » 笔记本40708G显卡和32GB内存部署本地大模型QWEN3.6 35b

评论 抢沙发

登录

找回密码

注册