<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Llama on YennJ12 Engineering Blog</title><link>https://yennj12.js.org/yennj12_blog_V4/tags/llama/</link><description>Recent content in Llama on YennJ12 Engineering Blog</description><generator>Hugo -- gohugo.io</generator><language>en-us</language><lastBuildDate>Thu, 16 Jul 2026 09:00:00 +0800</lastBuildDate><atom:link href="https://yennj12.js.org/yennj12_blog_V4/tags/llama/feed.xml" rel="self" type="application/rss+xml"/><item><title>ollama on mac - part 2 - 公開模型全覽與選型指南</title><link>https://yennj12.js.org/yennj12_blog_V4/posts/ollama-on-mac-part2-public-models-zh/</link><pubDate>Thu, 16 Jul 2026 09:00:00 +0800</pubDate><guid>https://yennj12.js.org/yennj12_blog_V4/posts/ollama-on-mac-part2-public-models-zh/</guid><description>大多數人第一次用 Ollama:直接 ollama pull 最大的那個模型,結果風扇狂轉、記憶體爆掉、每個 token 都要等半天。
資深工程師的做法:先看硬體能承受多大、再看任務需要什麼能力、最後用量化把尺寸壓進記憶體。
選對「尺寸 + 量化 + 任務」的 8B 模型,體感往往勝過硬撐一個跑不動的 70B。
Part 1 我們裝好了 Ollama,也跑起了第一個本地模型。這一篇要解決的是所有人接下來立刻會撞到的問題:模型這麼多,到底該選哪一個?
Ollama 官方模型庫裡有數十個家族、上百個 tag,尺寸從 1B 到 70B+、量化從 Q4 到 fp16、能力從純文字到多模態、從對話到推理。如果沒有一套選型框架,你只會反覆下載、反覆刪除,浪費頻寬也浪費時間。
這篇文章的目標,是給你一套可重複使用的選型心智模型,讓你面對任何新模型都能三秒鐘判斷「這個能不能在我的 Mac 上跑、值不值得跑」。
一、選型心智模型:硬體 → 任務 → 量化 在打開 ollama.com/search 之前,先在腦中建立一個三層漏斗。順序不能顛倒:硬體決定你的「上限」,任務決定你的「方向」,量化幫你在上限內「塞進最大的模型」。
┌──────────────────────────────┐ 第一層 │ 1. 硬體 (Hardware) │ 決定「上限」 │ 你的 Mac 有多少 RAM? │ │ → 決定模型參數量的天花板 │ └───────────────┬──────────────┘ │ 篩掉所有跑不動的尺寸 ▼ ┌──────────────────────────────┐ 第二層 │ 2. 任務 (Task) │ 決定「方向」 │ 對話?</description></item><item><title>ollama on mac - part 1 - 安裝與第一個本地模型</title><link>https://yennj12.js.org/yennj12_blog_V4/posts/ollama-on-mac-part1-installation-zh/</link><pubDate>Wed, 15 Jul 2026 09:00:00 +0800</pubDate><guid>https://yennj12.js.org/yennj12_blog_V4/posts/ollama-on-mac-part1-installation-zh/</guid><description>大部分人第一次聽到「在自己的 Mac 上跑 LLM」,直覺反應是:那不是要一張幾萬塊的顯示卡、還要會編譯一堆奇怪的 C++ 專案嗎? 現實是:在 Apple Silicon 的 Mac 上,你只要下載一個 .dmg、拖進 /Applications,再打一行 ollama run llama3.2,兩分鐘後就能跟一個本地模型對話。 沒有 API 金鑰、沒有帳單、沒有網路也能用,而且你的 prompt 永遠不會離開這台電腦。 這一系列會帶你從安裝一路走到 API 整合與工具呼叫;這篇 Part 1,我們先把地基打穩。
一、為什麼要在本機跑 LLM? 在動手安裝之前,先搞清楚一件事:為什麼不直接用 OpenAI、Claude 這類雲端 API 就好? 這決定了 Ollama 值不值得你花時間。
本地跑 LLM 的核心價值有五個:
隱私(Privacy):你的 prompt、公司的程式碼、病歷、合約草稿,全部留在這台 Mac 上,不會經過任何第三方伺服器。對受法規管制的產業(醫療、金融、法務)這幾乎是唯一能用 LLM 的方式。 離線(Offline):飛機上、咖啡廳的爛 Wi-Fi、公司內網隔離環境,只要模型已經下載好,完全不需要網路。 零 API 費用(Zero cost):雲端 API 是按 token 計費,重度使用一個月幾百美金跑不掉。本地模型下載後,你想 call 幾百萬次都是免費的,只花電費。 低延遲(Low latency):沒有網路來回(round-trip),第一個 token 通常在幾十毫秒內就出來,適合需要即時回饋的互動場景。 可實驗(Experimentation):想試不同模型、改參數、自訂 system prompt、做 fine-tune、跑 RAG,本地環境讓你毫無顧忌地亂玩,不用擔心帳單爆炸。 當然,天下沒有白吃的午餐。本地跑 LLM 的取捨大致如下:</description></item></channel></rss>