В 2026 году open source AI — это уже не только «ещё одна обёртка над ChatGPT». На GitHub быстрее всего растут проекты инфраструктурного слоя: те, что превращают «грязные» PDF в чистый Markdown, дают Agent память между сессиями и даже позволяют запустить 70B на видеокарте с 4 ГБ VRAM. Если вы строите RAG, корпоративную базу знаний или multi-agent продукт, правильный выбор open source-компонентов часто выгоднее, чем переход на более крупную закрытую модель.
Опираясь на недавние внедрения команды Kvmzen и сигналы сообщества, мы собрали 10 AI open source проектов, на которые стоит обратить внимание в 2026 году — по четырём направлениям: обработка PDF, память Agent, инференс при минимальной VRAM, оркестрация и локальное развёртывание. Ниже — критерии выбора, типовые связки, типичные ошибки и связь с облачным Mac.
Критерии отбора: что считать «трендовым»
Мы не сортировали проекты только по числу звёзд. Каждый кандидат проходил четыре проверки:
- Активная поддержка за последние 12 месяцев — стабильные релизы, ответы в Issues, обновлённая документация
- Решение реальной боли — битый PDF, Agent без памяти, нехватка VRAM, разрозненные API-провайдеры
- Встраивание в существующий стек — Python SDK или OpenAI-совместимый API, а не закрытый чёрный ящик
- Наблюдаемость в продакшене — логи, метрики или явное разделение экспериментального и боевого режима
Если вы системно изучаете разработку Agent, начните с нашего материала Путь обучения AI Agent (2026): книги, курсы и open source для новичков, а затем пройдите по списку ниже на практике.
Три инструмента для PDF и документов
В RAG главный источник «мусор на входе — мусор на выходе» — часто именно парсинг PDF. В 2026 году в сообществе сходятся на том, что универсального парсера нет, но три проекта ниже закрывают около 80% сценариев.
1. Docling (IBM)
Лицензия MIT, поддержка IBM Research. Работает с PDF, DOCX, PPTX, HTML и другими форматами. Сильные стороны — структурированное восстановление таблиц, колонтитулов и многоколоночной вёрстки с выводом в JSON или Markdown для индексации. Подходит для корпоративных конвейеров базы знаний: Docker, интеграция с LangChain и LlamaIndex.
2. Marker
Фокус на качественной конвертации PDF и EPUB в Markdown. Лучше большинства универсальных OCR справляется с академическими статьями и техническими white paper — формулы, сноски. На GPU — десятки страниц в минуту. Если корпус в основном на английском и цель — чистый Markdown для нарезки на чанки, Marker часто оказывается лучшим первым шагом.
3. MinerU
Open source-решение с сильными результатами на китайских сканах, сложных таблицах и учебниках. Хорошо сочетается с Docling: MinerU усиливает OCR-страницы, Docling выдаёт единую схему.
Память Agent: Mem0 и Zep
Agent без памяти каждый раз встречается с пользователем как с незнакомцем. В 2026 году слой памяти ушёл от схемы «всю историю в контекст» к отдельному сервису с поиском, обновлением и аудитом.
4. Mem0
Позиционируется как «memory layer for AI apps»: API долгосрочной памяти на уровне пользователя и сессии, автоматическое извлечение фактов из диалога и дедупликация. Документация по интеграции с LangGraph, CrewAI и AutoGen — самый быстрый путь к «запоминанию предпочтений». Подходит для личных ассистентов, coding Agent и SaaS-прототипов.
5. Zep
В 2025–2026 Zep активно развивает временные графы знаний Graphiti: не только «пользователь любит тёмную тему», но и когда факт стал действительным и когда был опровергнут — с графовыми запросами и аудитом для compliance. Подходит для поддержки, CRM и медицинских сценариев, где нужна прослеживаемая цепочка памяти. Развёртывание и моделирование тяжелее, чем у Mem0.
70B на GPU 4 ГБ: AirLLM
6. AirLLM
Заголовок про «GPU 4 ГБ и модель 70B» в этой статье почти всегда означает AirLLM. Поуровневая инференция: веса на SSD, на GPU загружается один слой Transformer за раз. Llama 3.1 70B даёт пик около 4 ГБ VRAM, есть поддержка Apple Silicon и MLX. Компромисс: обычно 0,5–3 tokens/s и первичная загрузка ~130 ГБ разбитых весов.
Полный бенчмарк мы опубликовали в тот же день — см. Можно ли запустить модель 70B на видеокарте 4 ГБ? AirLLM: тесты и настройка. Кратко: AirLLM — инструмент проверки гипотез, а не продакшен-API.
Оркестрация Agent: LangGraph и CrewAI
7. LangGraph
От команды LangChain: оркестрация Agent через граф состояний. Поток моделируется узлами и рёбрами, есть циклы, прерывания для ручной проверки и persistent checkpoint. К 2026 году — де-факто стандарт для backend-сервисов, где важен точный порядок вызова инструментов и повтор при сбое.
8. CrewAI
Абстракция multi-agent через роли и делегирование задач — Researcher, Writer, Reviewer в YAML. Кривая обучения мягче, чем у LangGraph, отлично для прототипов и демо. В продакшене часто смешивают: CrewAI для ролей, LangGraph для автомата состояний и наблюдаемости.
Локальное развёртывание: Ollama и LiteLLM
9. Ollama
Одна команда — загрузить и запустить open source веса на macOS, Linux и Windows. В 2026 году поддерживается широкий набор квантизированных и мультимодальных моделей — стандартный выбор для первой локальной машины разработчика. В паре с Open WebUI — внутренний чат для команды.
10. LiteLLM
Единый OpenAI-совместимый шлюз для Ollama, Anthropic, Azure, Bedrock и др. — один API с маршрутизацией, повторами и учётом стоимости. Когда Cursor, CLI и собственные Agent делят модели, LiteLLM избавляет от настройки ключей в каждом клиенте. По духу близок к шлюзам вроде OmniRoute в нашем блоге, но сфокусирован на слое LLM-инференса.
Сравнение и рекомендуемые связки
| Проект | Направление | Лучше всего для | Главный компромисс |
|---|---|---|---|
| Docling | Корпоративные конвейеры нескольких форматов | Сложные сканы требуют OCR заранее | |
| Marker | Англоязычные академические PDF → Markdown | Слабее на китайском и рукописном тексте | |
| MinerU | Китайские сканы, учебники | Меньше интеграций в англоязычной экосистеме | |
| Mem0 | Память | Быстрое долгосрочное запоминание пользователя | Ограниченное сложное графовое рассуждение |
| Zep | Память | Временные факты и аудит | Более тяжёлое развёртывание |
| AirLLM | Инференс | Проверка 70B на 4 ГБ VRAM | Очень медленно, много диска |
| LangGraph | Оркестрация | Stateful Agent в продакшене | Крутая кривая обучения |
| CrewAI | Оркестрация | Multi-role прототипы | Меньше контроля, чем у LangGraph |
| Ollama | Развёртывание | Локальная загрузка моделей для разработки | Крупные модели всё равно едят RAM и диск |
| LiteLLM | Шлюз | Единый API нескольких провайдеров | Высокую доступность обеспечиваете сами |
Рекомендуемый минимальный стек (MVP): Ollama для моделей → LiteLLM для OpenAI-совместимой точки → LangGraph для инструментов → Mem0 для памяти → Marker для загруженных PDF. Сквозной демо за две недели — реалистичная цель.
Связь с облачным Mac и Apple Silicon
Большинство проектов из списка нативно работают на macOS, но диск, память и длительный инференс остаются узкими местами:
- Пакетная обработка PDF — Marker и MinerU быстрее на GPU; Mac mini тянет CPU-путь, крупные партии лучше гонять ночью на облачном узле
- Эксперименты с 70B — AirLLM на Apple Silicon через MLX; 24 ГБ единой памяти на порядок комфортнее, чем дискретная карта 4 ГБ
- Длинные задачи Agent — checkpoint LangGraph и файлы Ollama легко занимают десятки гигабайт; облачный Mac даёт стабильную среду и запас SSD
Разработчикам iOS и Flutter на Windows имеет смысл перенести эксперименты Ollama + LangGraph на облачный Mac: Unix-инструменты и преимущества Apple Silicon без WSL и возни с драйверами.
Стоимость, производительность и риски
Скрытый счёт «бесплатного» open source стека — время инженеров, электричество и диск. GPU 4 ГБ + AirLLM выглядит как нулевой API-бюджет, но 130 ГБ модели и скорость ниже 1 token/s растягивают цикл проверки. Помесячный облачный Mac часто окупается за 2–3 недели сэкономленного времени. API по токенам удобны при неопределённом трафике; локально — Ollama для разработки, в продакшене — маршрутизация через LiteLLM.
Частые вопросы
Для парсинга PDF в 2026 году — Docling или Marker?
Docling — для корпоративных конвейеров и нескольких форматов; Marker — для англоязычных академических PDF в Markdown; для китайских сканов — MinerU. A/B на 20 страницах надёжнее, чем смотреть на звёзды.
Mem0 или Zep?
Mem0 — быстрое пользовательское запоминание; Zep — временные факты, графовые связи и аудит. Могут сосуществовать: Mem0 для предпочтений, Zep для бизнес-графа фактов.
Можно ли запустить 70B на GPU 4 ГБ?
Да — поуровневая инференция AirLLM даёт пик ~4 ГБ VRAM при 0,5–3 tokens/s и большом SSD. Подробные цифры — в нашей статье про AirLLM.
Самый простой локальный стек Agent?
Ollama + LiteLLM + LangGraph + Mem0 + любой PDF-парсер; на macOS меньше всего зависимостей, на Windows — облачный Mac или WSL.
Соберите этот open source стек на Mac mini — проще и стабильнее
Почти все десять проектов из списка нативно работают на macOS: Homebrew для Python, Ollama для загрузки моделей одной командой, MLX для ускорения AirLLM и локального инференса. Единая память Apple Silicon позволяет Mac mini с 24 ГБ одновременно гонять пакетную обработку PDF и квантизированный 70B — без CUDA и WSL на Windows. M4 в простое потребляет около 4 Вт — удобно для длительных Agent-задач и ночной индексации.
По сравнению с PC той же ценовой категории macOS даёт низкий уровень сбоев, Gatekeeper и FileVault — надёжнее как общий удалённый узел разработки; компактный безвентиляторный корпус снижает стоимость круглосуточной работы. Если вы разрабатываете iOS или Flutter на Windows, перенос AI-лаборатории в облачный Mac часто выгоднее покупки новой видеокарты.
От парсинга PDF до памяти Agent — от проверки на 4 ГБ до продакшен-оркестрации — железо не должно быть потолком для экспериментов: узнайте о тарифах и прогоните весь open source стек 2026 на облачном Mac mini за один проход.