省下8张卡!开源EdgeRazor把大模型压到190MB,手机CPU解码狂飙15倍!
导语:将大模型压到百兆级别并在手机、电脑本地畅玩?这款开源利器帮你搞定。
把大语言模型(LLM)装进手机和 PC 本地化运行早已不是新鲜事,但高显存占用和慢如蜗牛的响应速度却让人头疼。由南京大学 LAMDA 团队与微软 AI 推出的开源工具库 EdgeRazor,打破了极低比特大模型“精度崩塌”的硬伤,能将大模型体积压低至百兆级,且在 PC 和手机端实现最高 15 倍的解码提速。
一、核心资源直达与在线体验
- 在线试玩:https://huggingface.co/spaces/zhangsq-nju/EdgeRazor-PlayGround
- GitHub 开源地址:https://github.com/zhangsq-nju/EdgeRazor
- Hugging Face 模型库:https://huggingface.co/collections/zhangsq-nju/edgerazor-nbit
- 学术论文:https://arxiv.org/abs/2605.04062
二、硬核数据:百兆体积与 15 倍解码狂飙
依托开源推理框架 llama.cpp,Qwen3-0.6B 量化模型在常规 CPU 算力(Apple M4 Pro)环境下跑出了极其优秀的成绩:


- 内存降维打击:1.58-bit EdgeRazor 量化模型体积缩减到 190MB(仅为原 16-bit 模型体积的 1/5.8),内存占用直降到 1/2.9,彻底解决手机和低端设备的硬件限制。
- 解码速度起飞:PC 端和手机端 CPU 部署后,解码速度分别实现 16 倍和 12 倍的飞跃。相比 16-bit 原版模型,自回归解码速度最大提升达 15.16 倍。
- 极限精度保留:不仅量化参数覆盖率达到 99.99%,在 1.88-bit 极低比特配置下,面对 GSM8K 等复杂数学和代码推理任务,依然保持稳定性能,告别传统 2-bit 量化算法的断崖跌落。


三、保姆级实操步骤:如何一键训练轻量化模型
EdgeRazor 采用零侵入的即插即用设计,不需要重构复杂的底层训练代码,只需单机多卡环境及以下三步即可训练出你自己的低比特模型:
- 写好配置文件:准备一个简单的配置文件,设定目标比特数、量化比例和蒸馏损失等参数。
- 灵活配比数据:导入你的训练数据集。EdgeRazor 支持人类标注数据与高质量合成数据自由搭配混训。
- 一键合并导出:通过 EdgeRazor 自动接管框架,系统将一键完成模型加载、自动注入 QAT 模块及知识蒸馏同步计算,直接输出量化后的低比特模型。
- 本地加载运行:将输出的 1.58-bit 等低比特模型传入 llama.cpp 推理环境,即可在 PC 电脑或手机端体验极佳的秒回服务。
© 版权声明
本文部分内容、图片整理自互联网公开渠道,版权归原作者所有。ACGFav 仅负责对信息进行整理、翻译或排版优化,不代表本站完全赞同其观点。若文中内容涉及版权问题,请通过本站“关于我们”页面联系站长,我们将尽快核实并处理。