在过去的几天里,DeepSeek成为了一个热门话题,几乎传遍了整个网络。虽然在线版和APP版的表现已经相当出色,但将这个模型部署到本地,无疑是实现个性化定制的最佳途径!只有如此,DeepSeek R1才能真正做到“为你所用”。
许多用户在选择本地部署时,通常会选择蒸馏过的8B、32B或70B版本;但这些微调过的Llama或Qwen模型并不能完全展现DeepSeek R1的真正实力。不过,完整的671B MoE模型也并非无法在本地实现。通过量化技术的针对性运用,我们可以大幅缩减模型的体积,使其能够在消费级硬件(如一台Mac Studio)上顺利运行。
那么,如何通过ollama工具在本地顺利部署671B的DeepSeek R1(完整未蒸馏版本)模型呢?一篇已在国外引起极大关注的简明教程在此奉上。
模型选择
首先,671B的DeepSeek R1全量模型文件体积高达720GB,绝大多数用户都认为这是一笔天文数字。因此,本文选择UnslothAI在HuggingFace上提供的动态量化版本来大幅度压缩模型文件,目的就是让更多的人能够在本地顺利部署完整模型。
动态量化的基本理念是:对模型中的一些关键层进行高质量的4-6位量化,而对于大部分相对不重要的混合专家层则应用1-2位量化。通过这种方式,DeepSeek R1全量模型能够缩小至最小131GB(经过1.58-bit量化),显著降低了本地部署的门槛,这意味着你甚至可以在单台Mac Studio上运行!
在我的测试中,选用了以下两个模型进行评估:
- DeepSeek-R1-UD-IQ1_M(671B,1.73-bit动态量化,158GB)
- DeepSeek-R1-Q4_K_M(671B,4-bit标准量化,404GB)
UnslothAI提供了四种动态量化模型(1.58至2.51比特,文件体积从131GB到212GB),用户可以根据自己的硬件条件灵活选择。官方说明可参考UnslothAI文档。
硬件需求
部署这样的庞大模型时,内存和显存的容量是主要的瓶颈。建议如下配置:
- DeepSeek-R1-UD-IQ1_M:内存+显存≥200GB
- DeepSeek-R1-Q4_K_M:内存+显存≥500GB
使用ollama模型部署后,支持CPU与GPU协同推理,用户可将一部分模型层加载至显存加以加速,因此可以将内存与显存的总和视为系统的“总内存空间”。
为了进一步帮助用户了解部署过程,接下来的步骤我将详细列出,包括如何下载模型、安装ollama、创建模型文件,以及如何执行模型的具体命令。
部署步骤
下载模型文件:前往HuggingFace(https://huggingface.co/unsloth/DeepSeek-R1-GGUF)下载模型的太大文件体积,建议使用下载工具。
安装ollama:可以通过执行简单的脚本完成安装。具体命令为: bash curl -fsSL https://ollama.com/install.sh | sh
创建Modelfile文件:使用文本编辑器为模型建立描述文件,具体内容可参考本文实例。
创建ollama模型,执行创建命令。
运行模型,验证其性能。
如果内存不足,那么UnslothAI的1.73-bit动态量化版本显然更具实用性——它速度更快、资源占用更少,且效果并没有显著降低。
在消费级硬件上,我建议将其用于短文本生成等轻量任务,而在复杂的多轮对话中,它可能会显得力不从心。随着上下文长度增加,速度可能会变为令人沮丧的1-2 token/秒。因此,选择合适的任务和合理的上下文设置至关重要。
你在部署过程中发现了什么?有任何问题或经验分享也欢迎在评论区留言,让我们一起交流!
额外提示
若部署频繁出现内存不足的情况,可以尝试扩展系统交换空间,以提高可用内存的总量,具体方法请参考相关资料。随着技术的发展,相信在未来更高效、更便捷的本地部署方案会层出不穷,敬请期待!返回搜狐,查看更多