2026 年的 AI 開源生態不再只有「又一個 ChatGPT 套殼」。真正在 GitHub 上瘋漲 Star 的,是能把髒 PDF 變成乾淨 Markdown、給 Agent 裝上跨會話記憶、甚至讓4GB 舊顯卡跑通 70B 的基礎設施層。如果你在做 RAG、企業知識庫或多 Agent 產品,選對開源元件往往比換一個更大的閉源模型更划算。
本文從 Kvmzen 團隊近期落地與社群觀察出發,精選 10 個 2026 年最值得關注的 AI 開源專案,按 PDF 處理、Agent 記憶、極低顯存推理、編排與本地部署四條線梳理選型要點、組合方式與常見坑,並給出與雲端 Mac 的銜接建議。
篩選標準:什麼算「爆火」
我們用的不是單純 Star 數排行榜,而是四條可驗證標準:
- 近 12 個月活躍維護— 有穩定 release、Issue 回應與文件更新
- 解決真實痛點— PDF 亂碼、Agent 失憶、顯存不夠、API 供應商碎片化
- 可組合進現有棧— 提供 Python SDK 或 OpenAI 相容介面,而非封閉黑盒
- 生產可觀測— 有日誌、指標或明確的生產/實驗定位,避免「只能跑 Demo」
若你正在系統學習 Agent 開發,建議先讀我們的 AI Agent 學習路線(2026):新手必看的書籍、課程與開源專案,再按本文清單逐個動手驗證。
PDF 與文件處理三件套
RAG 專案裡,垃圾進、垃圾出的第一殺手往往是 PDF 解析。2026 年社群共識是「沒有萬能解析器」,但下面三個專案覆蓋了 80% 場景。
1. Docling(IBM)
MIT 許可,由 IBM Research 維護。支援 PDF、DOCX、PPTX、HTML 等格式,強項是表格、頁首頁尾與多欄版式的結構化還原,輸出 JSON 或 Markdown 供下游索引。適合企業知識庫流水線:統一入口、可 Docker 化、與 LangChain/LlamaIndex 有官方整合範例。
2. Marker
專注把 PDF、EPUB 高品質轉成 Markdown,對學術論文、技術白皮書的公式與腳註處理優於多數通用 OCR。速度在 GPU 上可達數十頁/分鐘。若你的語料以英文 PDF 為主、目標是乾淨 Markdown 再切塊,Marker 往往是性價比最高的第一步。
3. MinerU
國產開源方案,對中文掃描件、複雜表格與教材排版的識別率在社群口碑很高。適合國內政企文件、財報與教材類語料。可與 Docling 串聯:MinerU 做 OCR 增強,Docling 做統一 schema 輸出。
Agent 記憶:Mem0 與 Zep
沒有記憶的 Agent 每次對話都是陌生人。2026 年記憶層已從「把歷史訊息塞進 Context」進化成可檢索、可更新、可稽核的獨立服務。
4. Mem0
自稱「memory layer for AI apps」,提供使用者級與會話級長期記憶 API,自動從對話中抽取事實並去重。與 LangGraph、CrewAI、AutoGen 整合文件齊全,上手最快。適合個人助手、程式 Agent、需要「記住使用者偏好」的 SaaS 原型。
5. Zep
Zep 在 2025–2026 年大力推廣 Graphiti 時序知識圖譜:不僅存「使用者喜歡深色模式」,還能記錄事實何時生效、何時被推翻,支援圖查詢與合規稽核。適合客服、CRM、醫療等需要可追溯記憶鏈的場景。代價是部署與建模比 Mem0 重。
4GB 顯卡跑 70B:AirLLM
6. AirLLM
本文標題裡的「4G 顯卡跑 70B」幾乎專指 AirLLM。它用層式推理:權重躺在 SSD,GPU 每次只載入一個 Transformer 層,Llama 3.1 70B 顯存峰值約 4GB,支援 Apple Silicon + MLX。代價是速度通常 0.5–3 tokens/s,且首次需下載拆分約 130GB 模型。
我們在同日的專題裡做了完整實測,詳見 4GB 顯卡可以運行 70B 大模型嗎?AirLLM 實測與配置指南。一句話總結:AirLLM 是可行性驗證工具,不是生產 API 方案。
Agent 編排:LangGraph 與 CrewAI
7. LangGraph
LangChain 團隊出品的有狀態圖編排框架。把 Agent 流程建模為節點與邊,原生支援迴圈、人工審核中斷、持久化 checkpoint。2026 年已成為企業 Agent 的事實標準之一,適合需要精細控制工具呼叫順序與失敗重試的後端服務。
8. CrewAI
以「角色 + 任務委託」抽象多 Agent 協作,YAML 配置即可定義 Researcher、Writer、Reviewer 等角色。學習曲線比 LangGraph 平緩,原型與演示極快。生產環境常與 LangGraph 混用:CrewAI 做角色分工,LangGraph 管狀態機與觀測。
本地部署:Ollama 與 LiteLLM
9. Ollama
一行指令拉取並執行開源權重,macOS/Linux/Windows 全平台。2026 年已支援大量量化模型與多模態變體,是本地開發第一台機器的預設選擇。與 Open WebUI 搭配可做團隊內網 Chat 介面。
10. LiteLLM
統一 OpenAI 相容閘道,把 Ollama、Anthropic、Azure、Bedrock 等供應商收成同一套 API,內建路由、重試、成本追蹤。團隊裡 Cursor、CLI、自研 Agent 共用模型時,LiteLLM 能避免「每個客戶端配一遍 Key」的混亂——與 Kvmzen 部落格裡 OmniRoute 類閘道思路相通,但 LiteLLM 更偏 LLM 推理層。
橫向對比與推薦組合
| 專案 | 賽道 | 最適合 | 主要代價 |
|---|---|---|---|
| Docling | 企業多格式文件流水線 | 複雜掃描件需前置 OCR | |
| Marker | 英文學術 PDF → Markdown | 中文與手寫體較弱 | |
| MinerU | 中文掃描件、教材 | 英文生態整合略少 | |
| Mem0 | 記憶 | 快速加使用者長期記憶 | 複雜圖譜推理有限 |
| Zep | 記憶 | 時序事實與稽核 | 部署與維運更重 |
| AirLLM | 推理 | 4GB 顯存驗證 70B | 極慢、大磁碟 |
| LangGraph | 編排 | 有狀態生產 Agent | 概念多、學習曲線陡 |
| CrewAI | 編排 | 多角色原型 | 細粒度控制弱於 LangGraph |
| Ollama | 部署 | 本機拉模型開發 | 大模型仍吃記憶體/磁碟 |
| LiteLLM | 閘道 | 統一多供應商 API | 需自行保障高可用 |
推薦最小可行棧(MVP):Ollama 提供模型 → LiteLLM 暴露 OpenAI 相容端點 → LangGraph 編排工具 → Mem0 寫記憶 → Marker 處理上傳 PDF。兩週內可跑通端到端 Demo。
與 Cloud Mac / Apple Silicon 的銜接
上述專案大多能在 macOS 原生執行,但磁碟、記憶體與長時推理仍是瓶頸:
- PDF 批次處理— Marker、MinerU 在 GPU 上更快;Mac mini 可跑 CPU 路徑,大批量建議雲端節點夜間離線跑
- 70B 實驗— AirLLM 在 Apple Silicon 上可用 MLX,24GB 統一記憶體比 4GB 獨顯體驗好一個數量級
- Agent 長任務— LangGraph checkpoint、Ollama 模型檔案動輒數十 GB,雲端 Mac 提供固定環境與足夠 SSD,避免本機磁碟被撐滿
iOS/Flutter 開發者若本機是 Windows,把 Ollama + LangGraph 實驗遷到雲端 Mac,可同時解決 Unix 工具鏈與 Apple Silicon 推理優勢,無需維護 WSL 與驅動相容。
成本、效能與風險
成本上,純開源棧的「隱藏帳單」是工程師時間 + 電費 + 磁碟。4GB 獨顯 + AirLLM 看似零 API 費,但 130GB 模型與極慢速度會把驗證週期拉長;按月租雲端 Mac 往往在 2–3 週內攤平時間成本。API 按 Token 付費則適合流量不確定的初期產品,與本地棧可並行:開發用 Ollama,生產用 LiteLLM 路由到雲端。
常見問題
2026 年 PDF 解析選 Docling 還是 Marker?
Docling 偏企業流水線與多格式;Marker 偏英文學術 PDF 轉 Markdown;中文掃描件優先 MinerU。用 20 頁樣本做 A/B 再定,不要單看 Star。
Mem0 和 Zep 怎麼選?
快速給 Agent 加使用者記憶選 Mem0;需要時序事實、關係推理與稽核選 Zep。兩者可共存:Mem0 管偏好,Zep 管業務事實圖譜。
4GB 顯卡能跑 70B 嗎?
能,AirLLM 層式推理顯存峰值約 4GB,速度 0.5–3 tokens/s,需大容量 SSD。詳見本站 AirLLM 實測文。
本地 Agent 棧怎麼搭最省事?
Ollama + LiteLLM + LangGraph + Mem0 + 任一 PDF 解析器;macOS 依賴最少,Windows 建議雲端 Mac 或 WSL。
在 Mac mini 上組裝這套開源棧,更省心
本文 10 個專案裡,絕大多數在 macOS 上可原生執行:Homebrew 裝 Python、Ollama 一鍵拉模型、MLX 加速 AirLLM 與本地推理。Apple Silicon 統一記憶體讓 24GB 規格的 Mac mini 能同時跑 PDF 批次處理與量化 70B,不必在 Windows 上折騰 CUDA 與 WSL。M4 待機功耗約 4W,適合長時 Agent 任務與夜間索引作業。
與同價位 PC 相比,macOS 極低當機率、Gatekeeper 與 FileVault 安全機制,更適合作為團隊共享的遠端開發節點;體積小巧、無風扇設計也降低 7×24 執行的機房成本。若你正用 Windows 本機開發 iOS/Flutter,把這套 AI 實驗環境遷到雲端 Mac,往往比升級一塊新顯卡更划算。
從 PDF 解析到 Agent 記憶、從 4GB 驗證到生產級編排,硬體不應成為試錯的天花板——立即了解套餐方案,在雲端 Mac mini 上把 2026 開源棧一次跑通。