<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Modelfile on YennJ12 Engineering Blog</title><link>https://yennj12.js.org/yennj12_blog_V4/tags/modelfile/</link><description>Recent content in Modelfile on YennJ12 Engineering Blog</description><generator>Hugo -- gohugo.io</generator><language>en-us</language><lastBuildDate>Fri, 17 Jul 2026 09:00:00 +0800</lastBuildDate><atom:link href="https://yennj12.js.org/yennj12_blog_V4/tags/modelfile/feed.xml" rel="self" type="application/rss+xml"/><item><title>ollama on mac - part 3 - REST API 與自訂 Modelfile</title><link>https://yennj12.js.org/yennj12_blog_V4/posts/ollama-on-mac-part3-api-modelfile-zh/</link><pubDate>Fri, 17 Jul 2026 09:00:00 +0800</pubDate><guid>https://yennj12.js.org/yennj12_blog_V4/posts/ollama-on-mac-part3-api-modelfile-zh/</guid><description>大多數人用 Ollama:打開終端機,ollama run llama3.2,聊兩句就關掉。 資深工程師用 Ollama:把它當成一台跑在 localhost:11434 的本機 LLM 伺服器。 前者是玩具,後者是可以接進整個系統的基礎設施。 這一篇,我們把那道 HTTP 門推開。
在 Part 1 我們裝好了 Ollama、跑起第一個模型;Part 2 我們把公開模型全覽過一遍、學會怎麼選型。到這裡為止,你都還停留在 ollama run 這個「門面」。
但 ollama run 只是一個 CLI 包裝,它底下真正在做事的,是一個 HTTP 伺服器。只要你懂 REST API 與 Modelfile,你就能把 Ollama 從一個聊天玩具,升級成一個可以被任何程式語言呼叫、可以客製 persona、可以輸出結構化 JSON 的本機推論引擎。 這一篇是整個系列裡最偏「參考手冊」的一篇,建議收藏後隨查隨用。
一、為什麼 CLI 只是門面 當你輸入 ollama run llama3.2,實際發生的事情是:
CLI 檢查後台是否有 ollama serve 在跑(GUI App 會自動幫你起)。 CLI 透過 HTTP 呼叫 http://localhost:11434/api/chat。 伺服器把模型載入記憶體、跑推論、把結果串流回 CLI。 CLI 只是把串流的文字印在你的終端機上。 換句話說,你在終端機看到的每一個字,都是先經過一次 HTTP 往返的。CLI 能做的,你的程式全部都能做,而且能做得更多:控制參數、拿到 token 計數、強制 JSON 輸出、同時對多個模型下指令。</description></item></channel></rss>