2026-06-05
Ollama + Gemma4:12B + OpenClaw:本地模型与 AI Agent 部署流程
一份面向普通用户的本地大模型实操教程:从安装 Ollama、下载 Gemma4:12B、终端测试,到连接 OpenClaw、排查连接失败和模型卡顿。
这篇文档记录的是一次完整的本地大模型和本地 AI Agent 工作流测试:用 Ollama 在电脑上运行 Gemma4:12B,再把模型连接到 OpenClaw,体验一个不完全依赖云端模型的 AI Agent 流程。
它的重点不是证明“我成功跑起来了”,而是把一个对小白有门槛的技术流程拆开:每一步在做什么,为什么要这么做,看到什么结果算成功,遇到报错时下一步该怎么排查。
很多 AI 工具教程只展示成功截图,对普通用户帮助有限。真正难的地方往往不是输入那一条命令,而是命令没反应、模型下载失败、连接不上服务、Agent 网关超时、电脑突然变卡时,不知道问题出在哪里。
所以这篇文章会尽量把技术流程翻译成人话。读者不需要一开始就理解模型推理、API、网关这些概念,只需要按步骤完成,并在每一步看到一个明确结果。
一、先理解这套组合在干什么
Ollama 可以理解成本地大模型的运行器。它负责下载模型、管理模型、启动模型,并在本机开放一个本地接口,让终端、应用或 Agent 工具可以调用它。
Gemma4:12B 是这次实际运行的模型。模型可以理解成 AI 的“能力文件”。Ollama 本身不是模型,它更像运行环境;Gemma4:12B 才是真正负责生成回答的那部分。
OpenClaw 是 Agent 工作流入口。普通聊天工具通常是你问一句,它答一句;Agent 工具则更接近“让 AI 接入任务流程”,它需要连接模型,也需要处理任务、上下文和工具调用。
把这三者连起来,大致关系是:OpenClaw 负责交互和任务流程,Ollama 负责本地模型服务,Gemma4:12B 负责具体推理和回答。
OpenClaw -> Ollama -> Gemma4:12B
用户任务 -> 本地模型服务 -> 模型回答这个理解很重要。很多连接失败并不是模型坏了,而是链路中的某一段没有通:可能 Ollama 没启动,可能模型没下载,可能 OpenClaw 填错了模型名,也可能模型第一次加载太慢,导致上层工具以为请求超时。
二、准备工作:先确认电脑和网络
本地模型不是普通软件。它需要下载比较大的模型文件,也需要在运行时占用内存、显存或统一内存。Gemma4:12B 的模型文件本身已经是 GB 级别,实际运行时还会有额外开销。
如果电脑内存较小,或者同时开了很多大型软件,模型可以运行,但可能会慢。这里的慢不一定是安装失败,更多时候是硬件压力带来的正常现象。
开始之前建议先做三件事:第一,保证网络稳定,因为模型下载可能很大;第二,关闭暂时不用的大型软件;第三,预留足够磁盘空间,不要在硬盘快满时下载模型。
如果只是想验证流程,不一定非要一开始就用 12B 模型。可以先用更小的模型确认 Ollama 和 OpenClaw 的链路是通的,再回到 Gemma4:12B 做完整体验。
三、安装 Ollama
对普通用户来说,最简单的方式是去 Ollama 官网下载安装包,安装后像普通应用一样打开。打开以后,Ollama 会在后台提供本地模型服务。
如果你习惯终端,也可以用命令安装。不同系统安装方式会变化,实际操作时以 Ollama 官方下载页为准。安装完成后,先用版本命令确认终端能找到 Ollama。
ollama --version如果这条命令能输出版本号,说明 Ollama 已经安装,并且终端可以调用它。如果提示 command not found,通常不是模型问题,而是 Ollama 没装好,或者终端路径还没刷新。可以重新打开终端,或者重新安装 Ollama。
接着确认 Ollama 服务是否能响应。很多桌面安装方式会自动启动后台服务;如果没有启动,可以手动运行服务命令。
ollama serve如果看到端口占用相关提示,也不一定是坏事。它可能表示 Ollama 服务已经在后台运行了。真正要确认的是后面能不能拉模型、能不能运行模型、能不能访问本地接口。
四、下载 Gemma4:12B
安装好 Ollama 后,下一步是下载模型。模型名要写准确,这里使用的是 Gemma4 的 12B 版本。
ollama pull gemma4:12b这一步最容易卡在网络和下载速度上。模型文件比较大,下载过程中看起来慢是正常的。如果中断了,可以重新执行同一条命令,Ollama 通常会继续处理未完成的下载。
下载完成后,可以查看本地已经有哪些模型。
ollama list如果列表里能看到 gemma4:12b,说明模型已经在本地了。这个结果很关键,因为后面 OpenClaw 连接时也要填写同一个模型名。模型名多一个空格、少一个标签,都可能导致上层工具找不到模型。
五、先在终端里跑通模型
在连接 OpenClaw 之前,不要急着把所有工具接起来。最稳妥的做法是先在终端里确认模型本身能回答问题。
ollama run gemma4:12b进入对话后,可以输入一个很简单的问题,例如:
请用三句话解释什么是本地大模型。如果模型开始输出回答,说明 Ollama 和 Gemma4:12B 这一段已经跑通。第一次运行可能比较慢,因为模型需要加载进内存。不要用第一次响应速度直接判断模型是否不可用。
如果想退出终端对话,可以使用快捷键或输入退出指令,具体取决于当前终端交互状态。退出后可以查看当前是否还有模型在运行。
ollama ps六、用本地 API 做一次连接测试
OpenClaw 这类工具连接 Ollama,本质上不是“打开了同一个软件”,而是通过本机接口访问 Ollama。Ollama 默认会在本机提供服务,常见地址是 http://localhost:11434。
在接入 Agent 之前,可以先用 curl 测试这个接口。如果这一步能成功,说明外部工具理论上也能通过同样地址访问 Ollama。
curl http://localhost:11434/api/chat \
-d '{
"model": "gemma4:12b",
"messages": [
{"role": "user", "content": "用三句话解释 Ollama 的作用。"}
],
"stream": false
}'如果返回里能看到模型生成的内容,说明本地 API 可用。如果这里都连不上,先不要排查 OpenClaw,应该先回到 Ollama:确认应用是否打开、服务是否启动、模型名是否正确、端口是否被占用。
七、连接 OpenClaw
当终端测试和 API 测试都通过之后,再连接 OpenClaw。这样排错会简单很多,因为你已经知道模型本身是可用的,问题只可能出在 OpenClaw 的配置、权限、网络或超时设置上。
如果使用 Ollama 提供的应用启动方式,可以尝试直接通过 Ollama 启动 OpenClaw 并指定模型。
ollama launch openclaw --model gemma4:12b如果你是在 OpenClaw 里手动配置模型,一般需要关注三个字段:模型提供方选择 Ollama 或本地模型;Base URL 填 http://localhost:11434;Model 填 gemma4:12b。API Key 如果界面强制要求,可以先按 OpenClaw 的本地模型说明填写占位值。
连接后先不要让 Agent 做复杂任务。第一条测试消息应该非常简单,比如让它介绍当前模型,或者让它总结一句话。小任务能成功,再逐步测试更长的上下文、更复杂的工具调用和更接近真实工作流的任务。
八、常见问题和排查顺序
问题一:终端提示 command not found。优先判断 Ollama 是否安装成功,或者终端是否需要重新打开。这个错误发生在最外层,和 Gemma4:12B 没有关系。
问题二:模型下载很慢、失败或中断。先看网络,再重试同一条 pull 命令。模型下载不是小文件传输,中途失败很常见,不要立刻换一堆配置。
问题三:提示 model not found。优先检查模型名。本文使用的是 gemma4:12b,不是 gemma4:12B,也不是 gemma4 12b。最可靠的方法是运行 ollama list,看本地列表里实际叫什么。
问题四:连接 localhost:11434 失败。说明 OpenClaw 或 curl 没有连到 Ollama 服务。先打开 Ollama 应用,或者运行 ollama serve,再测试 API。不要直接在 OpenClaw 里反复改模型参数。
问题五:OpenClaw 网关超时。常见原因是模型第一次加载太慢、机器资源紧张、请求上下文太长,或者 Agent 上来就触发了复杂流程。可以先在终端里预热模型,再让 OpenClaw 发一个短问题。
ollama run gemma4:12b "用一句话回答:你现在可以工作吗?"问题六:模型运行卡顿。卡顿不一定是报错。12B 模型对普通电脑已经有一定压力,尤其是第一次加载、长上下文、多轮对话、Agent 工具调用同时发生时。可以关闭其他应用,缩短输入,或者先用小模型验证流程。
问题七:Agent 回答正常,但执行任务不稳定。这个问题通常不是“模型能不能说话”,而是 Agent 工作流本身更复杂。它涉及权限、工具、上下文、文件访问和任务拆解。建议先从只读任务开始,比如总结文本、解释文件,再逐步尝试写入或执行类任务。
九、本地 AI Agent 工作流的真实体验
本地模型跑起来之后,最直观的感受是控制感更强。模型在自己电脑上,服务地址在本机,很多测试不需要每次都依赖云端 API。对学习者来说,这会让 AI 从一个网页产品变成一套可以拆开理解的系统。
但本地并不等于没有成本。下载、内存、速度、配置、兼容性、Agent 权限,都会变成你需要理解的一部分。云端工具把这些复杂度藏起来,本地部署则把复杂度重新交还给用户。
这不是坏事。对于想真正理解 AI 工具的人来说,本地部署最大的价值,就是让你看见模型、运行环境、接口和 Agent 之间的关系。你不再只是在一个聊天框里提问,而是在搭一条自己的 AI 工作流链路。
这次体验也让我更确定:小白不是不愿意学,而是不知道每一步为什么要这么做,也不知道报错之后该怎么办。好的教程不能只写“输入这条命令”,还要告诉用户这条命令在验证什么,成功标志是什么,失败后应该先看哪一层。
十、最后的建议
如果你第一次尝试本地大模型,不要一上来就追求完整 Agent 自动化。先按顺序完成四个结果:Ollama 能输出版本号,Gemma4:12B 能出现在 ollama list,终端里能回答问题,本地 API 能返回内容。
这四个结果都成立以后,再连接 OpenClaw。否则问题会混在一起:你不知道是模型没下载、服务没启动、接口不通,还是 Agent 配置有问题。
本地 AI Agent 的学习路径,不是一次把所有东西装好,而是把链路一段一段点亮。先让模型能跑,再让接口能通,再让 Agent 能连,最后才谈真实工作流。
当你能自己完成这套流程,也能解释每一步的作用时,本地大模型就不再是一个神秘黑盒,而是一个可以被理解、复现和排错的工具系统。