2026 年的 AI 开源生态不再只有「又一个 ChatGPT 套壳」。真正在 GitHub 上疯涨 Star 的,是能把脏 PDF 变成干净 Markdown、给 Agent 装上跨会话记忆、甚至让 4GB 旧显卡跑通 70B 的基础设施层。如果你在做 RAG、企业知识库或多 Agent 产品,选对开源组件往往比换一个更大的闭源模型更划算。
本文从 Kvmzen 团队近期落地与社区观察出发,精选 10 个 2026 年最值得关注的 AI 开源项目,按 PDF 处理、Agent 记忆、极低显存推理、编排与本地部署四条线梳理选型要点、组合方式与常见坑,并给出与云端 Mac 的衔接建议。
筛选标准:什么算「爆火」
我们用的不是单纯 Star 数排行榜,而是四条可验证标准:
- 近 12 个月活跃维护— 有稳定 release、Issue 响应与文档更新
- 解决真实痛点— PDF 乱码、Agent 失忆、显存不够、API 供应商碎片化
- 可组合进现有栈— 提供 Python SDK 或 OpenAI 兼容接口,而非封闭黑盒
- 生产可观测— 有日志、指标或明确的生产/实验定位,避免「只能跑 Demo」
若你正在系统学习 Agent 开发,建议先读我们的 AI Agent 学习路线(2026):新手必看的书籍、课程和开源项目,再按本文清单逐个动手验证。
PDF 与文档处理三件套
RAG 项目里,垃圾进、垃圾出的第一杀手往往是 PDF 解析。2026 年社区共识是「没有万能解析器」,但下面三个项目覆盖了 80% 场景。
1. Docling(IBM)
MIT 许可,由 IBM Research 维护。支持 PDF、DOCX、PPTX、HTML 等格式,强项是表格、页眉页脚与多栏版式的结构化还原,输出 JSON 或 Markdown 供下游索引。适合企业知识库流水线:统一入口、可 Docker 化、与 LangChain/LlamaIndex 有官方集成示例。
2. Marker
专注把 PDF、EPUB 高质量转成 Markdown,对学术论文、技术白皮书的公式与脚注处理优于多数通用 OCR。速度在 GPU 上可达数十页/分钟。若你的语料以英文 PDF 为主、目标是干净 Markdown 再切块,Marker 往往是性价比最高的第一步。
3. MinerU
国产开源方案,对中文扫描件、复杂表格与教材排版的识别率在社区口碑很高。适合国内政企文档、财报与教材类语料。可与 Docling 串联:MinerU 做 OCR 增强,Docling 做统一 schema 输出。
Agent 记忆:Mem0 与 Zep
没有记忆的 Agent 每次对话都是陌生人。2026 年记忆层已从「把历史消息塞进 Context」进化成可检索、可更新、可审计的独立服务。
4. Mem0
自称「memory layer for AI apps」,提供用户级与会话级长期记忆 API,自动从对话中抽取事实并去重。与 LangGraph、CrewAI、AutoGen 集成文档齐全,上手最快。适合个人助手、编程 Agent、需要「记住用户偏好」的 SaaS 原型。
5. Zep
Zep 在 2025–2026 年大力推广 Graphiti 时序知识图谱:不仅存「用户喜欢深色模式」,还能记录事实何时生效、何时被推翻,支持图查询与合规审计。适合客服、CRM、医疗等需要可追溯记忆链的场景。代价是部署与建模比 Mem0 重。
4GB 显卡跑 70B:AirLLM
6. AirLLM
本文标题里的「4G 显卡跑 70B」几乎专指 AirLLM。它用层式推理:权重躺在 SSD,GPU 每次只加载一个 Transformer 层,Llama 3.1 70B 显存峰值约 4GB,支持 Apple Silicon + MLX。代价是速度通常 0.5–3 tokens/s,且首次需下载拆分约 130GB 模型。
我们在同日的专题里做了完整实测,详见 4GB 显卡可以运行 70B 大模型吗?AirLLM 实测与配置指南。一句话总结:AirLLM 是可行性验证工具,不是生产 API 方案。
Agent 编排:LangGraph 与 CrewAI
7. LangGraph
LangChain 团队出品的有状态图编排框架。把 Agent 流程建模为节点与边,原生支持循环、人工审核中断、持久化 checkpoint。2026 年已成为企业 Agent 的事实标准之一,适合需要精细控制工具调用顺序与失败重试的后端服务。
8. CrewAI
以「角色 + 任务委托」抽象多 Agent 协作,YAML 配置即可定义 Researcher、Writer、Reviewer 等角色。学习曲线比 LangGraph 平缓,原型与演示极快。生产环境常与 LangGraph 混用:CrewAI 做角色分工,LangGraph 管状态机与观测。
本地部署:Ollama 与 LiteLLM
9. Ollama
一行命令拉取并运行开源权重,macOS/Linux/Windows 全平台。2026 年已支持大量量化模型与多模态变体,是本地开发第一台机器的默认选择。与 Open WebUI 搭配可做团队内网 Chat 界面。
10. LiteLLM
统一 OpenAI 兼容网关,把 Ollama、Anthropic、Azure、Bedrock 等供应商收成同一套 API,内置路由、重试、成本追踪。团队里 Cursor、CLI、自研 Agent 共用模型时,LiteLLM 能避免「每个客户端配一遍 Key」的混乱——与 Kvmzen 博客里 OmniRoute 类网关思路相通,但 LiteLLM 更偏 LLM 推理层。
横向对比与推荐组合
| 项目 | 赛道 | 最适合 | 主要代价 |
|---|---|---|---|
| Docling | 企业多格式文档流水线 | 复杂扫描件需前置 OCR | |
| Marker | 英文学术 PDF → Markdown | 中文与手写体较弱 | |
| MinerU | 中文扫描件、教材 | 英文生态集成略少 | |
| Mem0 | 记忆 | 快速加用户长期记忆 | 复杂图谱推理有限 |
| Zep | 记忆 | 时序事实与审计 | 部署与运维更重 |
| AirLLM | 推理 | 4GB 显存验证 70B | 极慢、大磁盘 |
| LangGraph | 编排 | 有状态生产 Agent | 概念多、学习曲线陡 |
| CrewAI | 编排 | 多角色原型 | 细粒度控制弱于 LangGraph |
| Ollama | 部署 | 本机拉模型开发 | 大模型仍吃内存/磁盘 |
| LiteLLM | 网关 | 统一多供应商 API | 需自行保障高可用 |
推荐最小可行栈(MVP):Ollama 提供模型 → LiteLLM 暴露 OpenAI 兼容端点 → LangGraph 编排工具 → Mem0 写记忆 → Marker 处理上传 PDF。两周内可跑通端到端 Demo。
与 Cloud Mac / Apple Silicon 的衔接
上述项目大多能在 macOS 原生运行,但磁盘、内存与长时推理仍是瓶颈:
- PDF 批处理— Marker、MinerU 在 GPU 上更快;Mac mini 可跑 CPU 路径,大批量建议云端节点夜间离线跑
- 70B 实验— AirLLM 在 Apple Silicon 上可用 MLX,24GB 统一内存比 4GB 独显体验好一个数量级
- Agent 长任务— LangGraph checkpoint、Ollama 模型文件动辄数十 GB,云端 Mac 提供固定环境与足够 SSD,避免本机磁盘被撑满
iOS/Flutter 开发者若本机是 Windows,把 Ollama + LangGraph 实验迁到云端 Mac,可同时解决 Unix 工具链与 Apple Silicon 推理优势,无需维护 WSL 与驱动兼容。
成本、性能与风险
成本上,纯开源栈的「隐藏账单」是工程师时间 + 电费 + 磁盘。4GB 独显 + AirLLM 看似零 API 费,但 130GB 模型与极慢速度会把验证周期拉长;按月租云端 Mac 往往在 2–3 周内摊平时间成本。API 按 Token 付费则适合流量不确定的初期产品,与本地栈可并行:开发用 Ollama,生产用 LiteLLM 路由到云端。
常见问题
2026 年 PDF 解析选 Docling 还是 Marker?
Docling 偏企业流水线与多格式;Marker 偏英文学术 PDF 转 Markdown;中文扫描件优先 MinerU。用 20 页样本做 A/B 再定,不要单看 Star。
Mem0 和 Zep 怎么选?
快速给 Agent 加用户记忆选 Mem0;需要时序事实、关系推理与审计选 Zep。两者可共存:Mem0 管偏好,Zep 管业务事实图谱。
4GB 显卡能跑 70B 吗?
能,AirLLM 层式推理显存峰值约 4GB,速度 0.5–3 tokens/s,需大容量 SSD。详见本站 AirLLM 实测文。
本地 Agent 栈怎么搭最省事?
Ollama + LiteLLM + LangGraph + Mem0 + 任一 PDF 解析器;macOS 依赖最少,Windows 建议云端 Mac 或 WSL。
在 Mac mini 上组装这套开源栈,更省心
本文 10 个项目里,绝大多数在 macOS 上可原生运行:Homebrew 装 Python、Ollama 一键拉模型、MLX 加速 AirLLM 与本地推理。Apple Silicon 统一内存让 24GB 规格的 Mac mini 能同时跑 PDF 批处理与量化 70B,不必在 Windows 上折腾 CUDA 与 WSL。M4 待机功耗约 4W,适合长时 Agent 任务与夜间索引作业。
与同价位 PC 相比,macOS 极低崩溃率、Gatekeeper 与 FileVault 安全机制,更适合作为团队共享的远程开发节点;体积小巧、无风扇设计也降低 7×24 运行的机房成本。若你正用 Windows 本机开发 iOS/Flutter,把这套 AI 实验环境迁到云端 Mac,往往比升级一块新显卡更划算。
从 PDF 解析到 Agent 记忆、从 4GB 验证到生产级编排,硬件不应成为试错的天花板——立即了解套餐方案,在云端 Mac mini 上把 2026 开源栈一次跑通。