本地 AI
2026 Mac 本地 AI 配置指南:内存、模型与第一条工作流
不追参数跑分,从真实任务出发选择内存、模型和本地工具,先跑通一个能长期使用的场景。
本地 AI 的体验由内存、模型、上下文长度和任务类型共同决定。只看“能不能启动”没有意义,关键是速度、稳定性和隐私需求是否匹配。
看完你会得到
- 16GB 适合小模型和轻量任务,32GB 更适合长期跑本地模型与 RAG
- 先选一个明确任务,再决定模型大小,不要为了跑分购买硬件
- 模型文件、缓存和知识库会持续占空间,系统盘至少预留充足空间
- 本地部署不等于绝对安全,知识库权限和日志仍要管理
01内存决定上限,任务决定是否需要上限
Apple Silicon 采用统一内存,模型运行时占用的内存也会影响系统和其它应用。16GB 适合 7B–8B 量化模型和日常问答;32GB 更适合 14B–30B、长上下文和多任务并行。
不要只根据参数量判断体验。模型量化方式、上下文长度、并发数量和推理框架都会显著影响速度。真正有效的方法是拿自己的任务分别测试短问答、长文总结和知识库检索。
02先从三类任务中选一个
第一类是隐私敏感的文本整理,例如会议纪要、个人笔记和内部资料。第二类是离线知识库问答,重点在文档切片、向量检索和引用来源。第三类是辅助写作与代码,重点在模型能力和工具调用。
一次只跑通一个任务。把输入、输出、失败案例和耗时记录下来,再决定是否需要更大模型或更多工具。
- 文本整理:强调隐私、速度和稳定输出
- 知识库问答:强调文档管理、检索质量和引用
- 写作与代码:强调长上下文、工具调用和模型能力
03第一条工作流:用 Ollama 跑通本地对话
安装 Ollama 后,先用一款中等规模模型测试基础问答。确认终端、模型下载和内存占用正常,再接入图形界面或本地知识库工具。
不要一开始就下载十几个模型。先保留一个通用模型,增加一个中文或代码专用模型即可。模型文件可以随时重新下载,混乱的目录和缓存却会长期占空间。
04第二条工作流:建立可追溯的本地知识库
把待检索资料放进独立目录,先清理重复文件,再按主题分层。导入知识库后,用“能否给出处”和“能否回答没有写在原文里的问题”分别测试。
重要结论必须回到原文核对。本地模型降低的是数据传输风险,不代表模型输出自动正确。