AI教程网

每天一篇AI教程

本地部署大模型完整指南:从下载到跑通

2026-08-05

本地部署大模型完整指南:从下载到跑通

说实话,我第一次在本地跑大模型的时候,心里挺没底的。总感觉这事儿应该很复杂,得配个高端显卡、写一堆代码才行。结果真上手了才发现,用Ollama这玩意儿,整个流程比装个微信还简单。今天就把我踩过的坑和摸索出来的经验一次性说清楚,保证你看完就能动手。

为啥非得在本地跑?云服务不香吗?

为啥非得在本地跑?云服务不香吗?

先说说我自己的情况吧。之前一直用ChatGPT和Claude的API,一个月下来光调用费就得几十刀。更烦的是,处理一些公司内部的敏感数据,总不能直接丢给国外的服务器吧?合规这块儿就过不去。

本地部署的好处其实就仨字:自由、隐私、省钱。部署一次之后,不管断网还是流量高峰,想怎么调就怎么调,完全不用看别人脸色。而且现在开源模型的水平,说实话已经相当能打了。像Qwen2.5-7B这种量级的模型,跑在本地完全够日常用了。

硬件到底要啥配置?别被忽悠了

网上很多教程一上来就让你上4090,整得人怪紧张的。其实没那么夸张,我自己的笔记本是i7-12700H + 16GB内存 + RTX 3060 Laptop(6GB显存),跑7B参数的模型完全没问题,速度大概每秒生成20-30个token,聊聊天、写写代码完全够用。

给大家一个参考:

模型大小 显存需求 内存需求 适合场景
3B/4B 4GB 8GB 简单问答、文本分类
7B/8B 6-8GB 16GB 日常对话、代码生成
13B/14B 12-16GB 32GB 更复杂的推理任务
30B+ 24GB+ 64GB+ 专业领域应用

注意啊,如果你没独显或者显存不够,也不是完全没戏。Ollama支持CPU推理,就是速度会慢不少。我试过用纯CPU跑7B模型,大概每秒3-5个token,虽然慢但确实能跑。内存16GB是底线,8GB的话建议用3B的小模型。

装Ollama,比装QQ还快

Ollama官网(ollama.com)直接下载对应系统的安装包就行。我用的Windows版本,安装包也就几百MB,一路下一步就完事。装完之后打开终端(CMD或PowerShell),输入:

ollama --version

看到版本号就说明装好了。

Mac用户更省心,直接brew install ollama一条命令搞定。Linux的话去GitHub仓库看下安装脚本,也是几行命令的事。

下载模型,一个命令的事

Ollama最让人喜欢的地方就是模型管理特别简单。它有个模型库,直接在命令行里拉取就行:

ollama run qwen2.5:7b

第一次运行会自动下载模型,大概4GB左右。看网速,我这边百兆宽带大概十分钟左右就下完了。下载完直接进入交互界面,就可以开始聊了。

常用的几个模型我列一下:

这些模型在HuggingFace上都能看到详细的评测数据,选的时候可以参考下MMLU、HumanEval这些指标。

跑起来之后能干啥?别只会聊天

跑起来之后能干啥?别只会聊天

模型跑起来之后,玩法其实挺多的。我最常用的几个场景:

代码生成:用ollama run codellama或者qwen2.5,让它写个爬虫、调个接口,效率挺高的。不过说实话,代码这块儿跟付费的GPT-4比还是有差距,但胜在免费。

本地知识库:配合ollama run qwen2.5 + LangChain + ChromaDB,可以把公司文档丢进去,做个简单的RAG问答系统。我搞了一个,把产品手册和FAQ都喂进去了,同事问问题直接在内部系统里搜,效果还不错。

批量文本处理:写个Python脚本调用Ollama的API,批量做摘要、翻译、情感分析。Ollama默认监听11434端口,用requests库直接调就行:

import requests

response = requests.post(
    'http://localhost:11434/api/generate',
    json={
        'model': 'qwen2.5:7b',
        'prompt': '给这段文本写个摘要:...'
    }
)

几个实用小技巧

用了一个多月,攒了几个经验分享下:

1. 显存不够用?试试量化版本

Ollama默认下载的模型一般是Q4_K_M量化版本,如果你显存实在紧张,可以在模型名后面加后缀,比如qwen2.5:7b-q2_K,会小很多,但效果会打折扣。反之,显存够大可以用q8_0版本,效果更好。

2. 后台常驻,别老开关

用ollama serve可以让Ollama在后台一直运行,这样你写代码或者用其他工具的时候,随时都能调用API。我一般开机就启动,占的内存大概1-2GB,可以接受。

3. 多模型切换不麻烦

ollama list查看已下载的模型,ollama run加模型名随时切换。我电脑上常驻了qwen2.5和llama3.1两个,一个管中文一个管英文。

4. 配合Open WebUI更香

命令行界面虽然够用,但不够直观。装个Open WebUI,用Docker跑一下:

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

然后浏览器打开localhost:3000,就是类似ChatGPT的界面了,还能管理对话历史。

折腾了这么久,我的真实感受

说实话,本地部署大模型这事儿,技术上确实没想象中难,Ollama把最麻烦的部分都封装好了。但要说体验跟ChatGPT Plus比,差距还是在的。响应速度、生成质量、上下文长度这些,本地模型都有一定距离。

但你要说值不值得折腾?我觉得分情况。如果你对数据隐私有要求,或者API调用量大想省钱,或者想折腾点定制化的应用,那本地部署绝对值得一试。 反正是免费的,装一个玩玩又不亏。

我身边已经有好几个同事被我安利成功,现在他们写周报都直接在本地跑qwen帮忙润色了。哪天有空你也可以试试,遇到啥问题欢迎来交流。