Kvmzen 部落格
← 返回技術實踐

AI Agent 學習路線(2026):新手必看的書籍、課程與開源專案

AIDevelopment ·約 14 分鐘閱讀

AI Agent 學習路線與智能代理開發

2026 年的「AI Agent」早已不是 Demo 裡的噱頭。從 Cursor 的自主編碼、客服系統的多輪工具呼叫,到企業內部的審批與資料查詢自動化,能規劃、能呼叫工具、能自我糾錯的智能代理正在成為後端與全端工程師的常規技能。

但新手最常見的困境是:教學滿天飛,卻不知道先學什麼、讀哪本書、跟哪門課、該 fork 哪個倉庫。本文給出一條可執行的 2026 學習路線——按階段拆分前置知識、書籍、課程與開源專案,並附上每個階段的驗收標準,避免「收藏了 50 個倉庫卻一行程式碼沒寫」。

4 階段
從零到可上線 Agent
8 本
精選書籍與論文
12+
值得精讀的開源專案

先搞清楚:什麼是 AI Agent

在工程語境裡,AI Agent(智能代理)通常指:以大語言模型為「大腦」,在外部環境中透過感知 → 規劃 → 行動 → 觀察結果 → 再規劃的循環完成任務的一類系統。它和「單次問答的 Chatbot」的區別在於:

  • 有目標——不只是回答問題,而是要完成「查庫存並下單」「修完這個 bug 並跑通測試」這類任務
  • 能呼叫工具——搜尋、執行程式碼、讀寫檔案、呼叫 API、操作瀏覽器等
  • 有多步推理——根據中間結果調整策略,而不是一次性輸出最終答案
  • 有狀態與記憶——跨輪次保留上下文、使用者偏好或任務進度

2026 年的 Agent 生態可以粗分為三層:框架層(LangGraph、CrewAI、OpenAI Agents SDK 等)、平台層(Dify、Coze、n8n 等低程式碼編排)和應用層(編碼 Agent、客服 Agent、資料分析 Agent)。新手建議從框架層入手寫程式碼,再根據需要接觸平台層——這樣你才能真正理解失敗時該改哪一層。

術語對齊
業界常把「Agent」「智能體」「自主代理」混用。本文統一稱 AI Agent,並預設你使用的是雲端 LLM API(OpenAI、Anthropic、Google Gemini、國產大模型等),而非從零訓練模型。

前置技能清單

你不需要機器學習博士背景,但以下基礎會顯著縮短學習曲線:

技能 最低要求 推薦補強
Python 函式、類別、非同步 async/await、虛擬環境 型別標註、pydantic、套件管理(uv / poetry)
HTTP / REST API 會用 requestshttpx 呼叫介面 Webhook、SSE 串流回應、OAuth
命令列與 Git 複製倉庫、跑範例、提交 PR Docker 基礎、CI 日誌閱讀
JSON / 結構化輸出 能解析和建構 JSON JSON Schema、函式呼叫(Function Calling)
(可選)前端 用簡單 UI 展示 Agent 軌跡,便於除錯

若你已有 JavaScript/TypeScript 背景,OpenAI Agents SDK、Vercel AI SDK 和 Mastra 也是可行入口;但中文資料與範例仍以 Python 生態最豐富,本文路線以 Python 為主。

四階段學習路線

下面這條路線假設你每週能投入 8~12 小時。全職學習可壓縮到 6~8 週;業餘節奏約 3~4 個月能完成前三個階段。

階段一:LLM 與 Prompt 基礎(約 2 週)

目標:理解模型能力邊界,能穩定拿到結構化輸出,而不是只會寫「你是一個有用的助手」。

  • 註冊至少一家主流 API,熟悉金鑰管理、計費與限流
  • 練習 System / User / Assistant 訊息角色與多輪對話
  • 掌握 Few-shot、Chain-of-Thought、輸出格式約束(JSON mode / structured outputs)
  • 用簡單腳本完成:摘要、分類、資訊抽取三類任務

驗收標準:同一提示詞在 20 條測試樣本上格式錯誤率 < 10%;能解釋 temperature、max_tokens 對結果的影響。

階段二:單 Agent + 工具呼叫(約 3 週)

目標:讓模型能「動手」——查天氣、跑 Python、讀本機檔案、呼叫企業內部 API。

  • 理解 Function Calling / Tool Use 的請求與回應格式
  • 用 LangChain 或官方 SDK 實作 2~3 個自訂工具
  • 閱讀 ReAct 論文,理解「推理 + 行動」交替循環
  • 為工具呼叫加上逾時、重試與參數驗證

驗收標準:Agent 能在 5 步以內完成「根據自然語言查詢資料庫並回傳表格」類任務;失敗時能輸出可讀的錯誤原因。

階段三:編排、記憶與多 Agent(約 4 週)

目標:從「一個循環」升級到「可維護的工作流程」——分支、人工審核、長期記憶、多角色協作。

  • LangGraph 或類似框架畫狀態圖(節點、邊、條件跳轉)
  • 實作短期記憶(對話視窗)與長期記憶(向量庫 / 鍵值儲存)
  • 嘗試多 Agent:規劃者 + 執行者 + 審查者(CrewAI / AutoGen 風格)
  • 引入評估:準備 30+ 條任務用例,記錄成功率與平均步數

驗收標準:同一工作流程可設定不同模型;能在審查節點攔截高風險操作;有基本的 trace 日誌。

階段四:工程化與上線(約 3 週)

目標:把 Demo 變成可交付服務——安全、可觀測、可回滾。

  • 權限與沙箱:工具白名單、命令執行隔離、敏感資料脫敏
  • 可觀測性:OpenTelemetry、LangSmith、Langfuse 或自建日誌
  • 成本與限流:按使用者/任務計費、快取、模型降級策略
  • 部署:API 服務 + 佇列(處理長任務)+ 健康檢查

驗收標準:能在 staging 環境跑通 24 小時壓測;有告警與人工接管(human-in-the-loop)路徑。

學習順序建議
不要跳過階段一直接追多 Agent 框架。很多「Agent 不好用」的問題,本質是 Prompt 不穩定或工具介面設計糟糕,而不是框架選錯。

書籍與論文推薦

以下按「先廣度、再深度」排序。帶 ⭐ 的為 2026 年仍強烈建議入手的主線讀物。

入門與 LLM 應用

  • 《Hands-On Large Language Models》(Jay Alammar & Maarten Grootendorst)——用視覺化方式講清 Transformer、微調與 RAG,適合建立直覺
  • 《AI Engineering》(Chip Huyen, 2025)——從資料、評估到部署的完整工程視角,Agent 章節與生產實踐緊密相關
  • 《Building LLM Powered Applications》(Valentina Alto)——偏應用架構,適合已有後端經驗的讀者
  • 《Generative AI with LangChain》(Ben Auffarth & Ankush Thakur)——與 LangChain 生態配套,適合階段二同步閱讀

系統設計與進階

  • 《Designing Machine Learning Systems》(Chip Huyen)——雖非 Agent 專著,但評估、監控、資料漂移等概念直接適用於 Agent 上線
  • 《Prompt Engineering for Generative AI》(James Phoenix & Mike Taylor)——系統梳理提示詞模式,減少「玄學調參」

必讀論文(短、影響大)

📖 閱讀建議:書不必從頭到尾啃。階段一配合 LLM 書前四章;階段二配合 LangChain 書 + ReAct 論文;階段三再讀 AI Engineering 的評估與部署章節。

課程推薦(2026 仍有效)

以下課程大多免費或提供審計(audit)選項,且配有可執行的 Notebook。

課程 提供方 適合階段 亮點
ChatGPT Prompt Engineering for Developers DeepLearning.AI + OpenAI 階段一 短、密、立刻能用的 Prompt 模式
Functions, Tools and Agents with LangChain DeepLearning.AI 階段二 工具呼叫入門標竿課程
AI Agents in LangGraph DeepLearning.AI + LangChain 階段三 狀態圖、循環與人機協同
Multi AI Agent Systems with crewAI DeepLearning.AI + crewAI 階段三 角色化多 Agent 協作
Hugging Face Agents Course Hugging Face 階段二~三 開源模型 + 工具生態
Develop AI Agents on Azure Microsoft Learn 階段三~四 Semantic Kernel、企業整合視角

若你偏好影片 + 中文講解,可在 YouTube 或 B 站搜尋上述課程名稱,常有社群翻譯版;但務必跟著官方 Notebook 自己跑一遍,只看影片幾乎無法通過階段二的驗收標準。

開源專案精讀清單

倉庫不在多,在於「讀透 + 改一小處 + 跑通」。按學習順序分組如下。

階段二:單 Agent 與工具

  • LangChain——元件最全,先讀 toolsagents 模組範例
  • OpenAI Agents SDK——官方輕量 Agent 抽象,適合理解 Handoff 與 Guardrails
  • LlamaIndex——若任務以 RAG + Agent 為主,資料連接器值得細看

階段三:編排與多 Agent

  • LangGraph——2026 年最值得關注的狀態機式 Agent 框架,必讀
  • CrewAI——角色、任務、流程宣告式設定,上手快
  • Microsoft AutoGen——對話式多 Agent,適合研究協作模式
  • MetaGPT——「軟體公司」式多 Agent,理解分工與 SOP

階段四:編碼 Agent 與生產參考

  • OpenHands(原 OpenDevin)——自主程式 Agent 的完整棧,學習沙箱與工具設計
  • SWE-agent——專注解 GitHub Issue,論文與程式碼對齊
  • Langfuse——開源 LLM 可觀測性,適合自建 trace
  • Dify——低程式碼 Agent 平台,參考其 workflow 與知識庫產品設計
如何「精讀」一個倉庫
不要從 src 根目錄硬讀。正確路徑:① 讀 README 與 Quickstart;② 跑官方 example;③ 用除錯器跟一次完整 tool call;④ 只 fork 一個你關心的模組(如重試、記憶、權限)做最小修改。

動手專案建議

按難度遞增,每個專案對應路線中的驗收能力:

專案 階段 練到的能力
個人知識庫問答(PDF + 網頁) 一~二 RAG、引用溯源、Prompt 穩定性
自然語言查 SQL(唯讀庫) 工具呼叫、SQL 驗證、錯誤恢復
GitHub Issue triage 小助手 二~三 多步推理、標籤推薦、人工確認
「研究 → 大綱 → 初稿」寫作流水線 多 Agent、狀態持久化
帶審計日誌的內部維運 Agent 權限、沙箱、可觀測性、回滾

選專案時優先選你有真實痛點的場景。為了學習而做的「假客服」往往缺乏失敗樣本,評估集也很難寫真實。

新手常見誤區

  • 框架集郵——一週換三個框架,哪個都沒跑通生產路徑
  • 忽視評估——沒有固定測試集,憑感覺說「好像更聰明了」
  • 工具過多——模型在 20 個工具裡選錯;應從 2~3 個精確定義的工具開始
  • 無權限邊界——讓 Agent 直接執行 shell 或寫生產庫,出事再補救
  • 忽略成本——多 Agent + 長上下文 + 反覆重試,帳單會在月底給你驚喜
  • 死等「完美模型」——與 等待下一代模型 同理,架構可遷移比押注單一版本更重要

開發環境與 Mac 方案

Agent 開發通常是「編輯器 + 終端機 + 瀏覽器 + API 除錯」多視窗並行。若在 Windows 上做 iOS 側測試、或團隊需要統一的 macOS 環境跑 Xcode / 腳本 / 本機沙箱,雲端 Mac 比反覆折騰虛擬機更省心。

透過 Kvmzen Mac 雲租用,你可以在不購置實體裝置的情況下獲得固定規格的 macOS 環境,用於:

  • 跑 LangGraph / OpenHands 等依賴 Unix 工具鏈的範例
  • 與 Cursor、VS Code Remote 配合做 Agent 除錯
  • 將 Agent 產生的行動端修補在真實 Xcode 工程裡驗證

連線與計費說明見 幫助中心。學習路線本身不綁定特定硬體,但穩定、可重複的遠端開發環境會顯著減少「在我機器上能跑」類問題,讓你把精力放在 Agent 邏輯與評估上。

延伸閱讀

限時特惠

不只是一台 Mac,是你在雲端的開發基地

獨享算力 · 全球節點 · 按月訂閱 · 無需購置硬體

返回首頁
限時優惠 點擊查看套餐