En 2026, l'écosystème IA open source ne se résume plus à « encore un wrapper ChatGPT ». Ce qui grimpe vraiment sur GitHub, ce sont les briques d'infrastructure capables de transformer des PDF sales en Markdown propre, d'offrir aux Agents une mémoire inter-sessions, et même de faire tourner un 70B sur une carte 4 Go. Si vous construisez du RAG, une base de connaissances d'entreprise ou un produit multi-agents, choisir les bons composants open source coûte souvent moins cher que de passer à un modèle propriétaire plus gros.
À partir des déploiements récents de l'équipe Kvmzen et des signaux de la communauté, ce guide présente dix projets IA open source à suivre en 2026 — classés autour du traitement PDF, de la mémoire Agent, de l'inférence à très faible VRAM, de l'orchestration et du déploiement local — avec critères de sélection, combinaisons de stack, pièges courants et lien avec le Mac cloud.
Critères de sélection : qu'est-ce qui fait le buzz ?
Nous ne nous basons pas sur un simple classement de Stars, mais sur quatre critères vérifiables :
- Maintenance active sur 12 mois — releases stables, réponses aux Issues et documentation à jour
- Résout un vrai problème — PDF illisibles, Agents amnésiques, VRAM insuffisante, fragmentation des fournisseurs API
- Composable dans une stack existante — SDK Python ou interface compatible OpenAI, pas une boîte noire fermée
- Observable en production — logs, métriques ou positionnement clair prod/expérimentation, pas un simple démo
Si vous apprenez le développement Agent de façon structurée, commencez par notre Parcours d'apprentissage Agent IA (2026) : livres, cours et projets open source, puis validez chaque outil de cette liste en conditions réelles.
PDF et traitement documentaire : le trio gagnant
Dans un projet RAG, le premier tueur de qualité est souvent le parsing PDF : garbage in, garbage out. En 2026, le consensus communautaire est qu'il n'existe pas de parseur universel, mais ces trois projets couvrent environ 80 % des cas.
1. Docling (IBM)
Licence MIT, maintenu par IBM Research. Prend en charge PDF, DOCX, PPTX, HTML, etc. Point fort : restitution structurée des tableaux, en-têtes/pieds de page et mises en page multi-colonnes, avec sortie JSON ou Markdown pour l'indexation. Convient aux pipelines documentaires d'entreprise : entrée unifiée, conteneurisable, exemples d'intégration officiels avec LangChain et LlamaIndex.
2. Marker
Spécialisé dans la conversion PDF et EPUB vers Markdown de haute qualité, avec un traitement des formules et notes de bas de page supérieur à la plupart des OCR généralistes pour les articles académiques et livres blancs techniques. Sur GPU, la vitesse peut atteindre des dizaines de pages par minute. Si votre corpus est surtout en PDF anglais et que vous visez un Markdown propre avant découpage, Marker est souvent le meilleur premier passage.
3. MinerU
Solution open source chinoise avec un excellent taux de reconnaissance sur les documents scannés en chinois, tableaux complexes et manuels pédagogiques. Convient aux corpus institutionnels, rapports financiers et manuels. Peut s'enchaîner avec Docling : MinerU pour l'OCR renforcé, Docling pour un schéma de sortie unifié.
Mémoire Agent : Mem0 et Zep
Un Agent sans mémoire repart de zéro à chaque conversation. En 2026, la couche mémoire a évolué au-delà du simple « tout l'historique dans le contexte » vers un service consultable, actualisable et auditable.
4. Mem0
Se présente comme une « memory layer for AI apps » : API de mémoire à long terme par utilisateur et par session, extraction automatique des faits avec déduplication. Documentation d'intégration complète avec LangGraph, CrewAI et AutoGen — le plus rapide à mettre en place. Convient aux assistants personnels, Agents de codage et prototypes SaaS qui doivent « se souvenir des préférences utilisateur ».
5. Zep
Zep a fortement poussé Graphiti, son graphe de connaissances temporel, en 2025–2026 : il ne stocke pas seulement « l'utilisateur préfère le mode sombre », mais aussi quand un fait est devenu valide ou a été remplacé, avec requêtes graphe et pistes de conformité. Convient au support, au CRM et à la santé, là où une chaîne de mémoire traçable est requise. Le déploiement et la modélisation restent plus lourds que Mem0.
Carte 4 Go pour un 70B : AirLLM
6. AirLLM
Le « 70B sur carte 4 Go » de ce titre renvoie presque toujours à AirLLM. Inférence couche par couche : les poids restent sur le SSD, le GPU ne charge qu'une couche Transformer à la fois. Llama 3.1 70B atteint un pic d'environ 4 Go de VRAM, avec prise en charge Apple Silicon + MLX. Le compromis : 0,5 à 3 tokens/s en général, et un premier téléchargement d'environ 130 Go de modèle découpé.
Nous avons publié un test complet le même jour : voir Une carte graphique 4 Go peut-elle faire tourner un modèle 70B ? Tests AirLLM et guide de configuration. En résumé : AirLLM est un outil de validation de faisabilité, pas une solution d'API de production.
Orchestration Agent : LangGraph et CrewAI
7. LangGraph
Framework d'orchestration par graphe à état de l'équipe LangChain. Modélise le flux Agent en nœuds et arêtes, avec boucles natives, interruption pour validation humaine et checkpoints persistants. En 2026, c'est devenu l'un des standards de fait pour les Agents d'entreprise — idéal quand il faut contrôler finement l'ordre des appels d'outils et les nouvelles tentatives en cas d'échec.
8. CrewAI
Abstraction multi-agents par « rôle + délégation de tâches » : Researcher, Writer, Reviewer, etc., définis en YAML. Courbe d'apprentissage plus douce que LangGraph, prototypes et démos très rapides. En production, on le combine souvent avec LangGraph : CrewAI pour la répartition des rôles, LangGraph pour la machine à états et l'observabilité.
Déploiement local : Ollama et LiteLLM
9. Ollama
Une commande pour récupérer et exécuter des poids open source sur macOS, Linux et Windows. En 2026, prise en charge étendue des modèles quantifiés et des variantes multimodales — choix par défaut pour la première machine de développement locale. Associé à Open WebUI, il fournit une interface Chat en intranet pour l'équipe.
10. LiteLLM
Passerelle unifiée compatible OpenAI qui regroupe Ollama, Anthropic, Azure, Bedrock et autres sous une seule API, avec routage, nouvelles tentatives et suivi des coûts. Quand Cursor, le CLI et vos Agents maison partagent les mêmes modèles, LiteLLM évite de reconfigurer chaque clé — même logique que les passerelles type OmniRoute du blog Kvmzen, mais orientée couche d'inférence LLM.
Comparaison transversale et stacks recommandés
| Projet | Catégorie | Idéal pour | Principal compromis |
|---|---|---|---|
| Docling | Pipeline documentaire multi-formats en entreprise | Scans complexes nécessitent un OCR en amont | |
| Marker | PDF académiques anglais → Markdown | Chinois et écriture manuscrite plus faibles | |
| MinerU | Scans chinois, manuels | Moins d'intégrations côté écosystème anglophone | |
| Mem0 | Mémoire | Ajouter rapidement une mémoire utilisateur | Raisonnement graphe limité |
| Zep | Mémoire | Faits temporels et audit | Déploiement et ops plus lourds |
| AirLLM | Inférence | Valider un 70B avec 4 Go de VRAM | Très lent, gros disque |
| LangGraph | Orchestration | Agents à état en production | Courbe d'apprentissage raide |
| CrewAI | Orchestration | Prototypes multi-rôles | Contrôle fin inférieur à LangGraph |
| Ollama | Déploiement | Développement local de modèles | Gros modèles = RAM/disque importants |
| LiteLLM | Passerelle | API multi-fournisseurs unifiée | Haute disponibilité à assurer soi-même |
Stack MVP recommandée : Ollama pour les modèles → LiteLLM expose un endpoint compatible OpenAI → LangGraph orchestre les outils → Mem0 écrit la mémoire → Marker traite les PDF uploadés. Une démo bout en bout est réalisable en deux semaines.
Lien avec Cloud Mac / Apple Silicon
La plupart de ces projets tournent nativement sur macOS, mais disque, mémoire et inférence longue durée restent des goulots :
- Traitement PDF par lots — Marker et MinerU sont plus rapides sur GPU ; le Mac mini peut suivre en CPU, mais les gros volumes méritent un nœud cloud la nuit
- Expériences 70B — AirLLM fonctionne sur Apple Silicon via MLX ; 24 Go de mémoire unifiée offrent une expérience bien supérieure à une carte 4 Go
- Tâches Agent longues — checkpoints LangGraph et fichiers Ollama pèsent souvent des dizaines de Go ; un Mac cloud fixe l'environnement et le SSD sans saturer votre machine locale
Les développeurs iOS/Flutter sur Windows peuvent déplacer leurs expériences Ollama + LangGraph vers un Mac cloud : outillage Unix et inférence Apple Silicon sans maintenir WSL ni pilotes.
Coût, performance et risques
Sur le plan financier, la « facture cachée » d'une stack 100 % open source, c'est le temps ingénieur + électricité + disque. Carte 4 Go + AirLLM semble gratuit côté API, mais 130 Go de modèle et une vitesse très basse allongent les cycles de validation ; un Mac cloud au mois amortit souvent ce temps en 2 à 3 semaines. Les API au token conviennent aux produits à trafic incertain ; les deux approches peuvent coexister : Ollama en dev, LiteLLM route vers le cloud en prod.
Questions fréquentes
Docling ou Marker pour le parsing PDF en 2026 ?
Docling pour les pipelines multi-formats en entreprise ; Marker pour les PDF académiques anglais vers Markdown ; MinerU en priorité pour les scans chinois. Faites un A/B sur 20 pages avant de trancher — ne vous fiez pas aux Stars seules.
Comment choisir entre Mem0 et Zep ?
Mem0 pour ajouter rapidement une mémoire utilisateur à un Agent ; Zep pour les faits temporels, le raisonnement relationnel et l'audit. Les deux peuvent coexister : Mem0 pour les préférences, Zep pour le graphe de faits métier.
Une carte 4 Go peut-elle faire tourner un 70B ?
Oui : AirLLM en inférence couche par couche, pic VRAM ~4 Go, vitesse 0,5–3 tokens/s, SSD volumineux requis. Voir notre article de tests AirLLM sur ce site.
Quelle stack Agent locale est la plus simple ?
Ollama + LiteLLM + LangGraph + Mem0 + un parseur PDF ; le moins de friction sur macOS, WSL ou Mac cloud recommandé sous Windows.
Assembler cette stack open source sur Mac mini, plus sereinement
La grande majorité des dix projets de cet article tournent nativement sur macOS : Python via Homebrew, Ollama en une commande, MLX pour accélérer AirLLM et l'inférence locale. La mémoire unifiée d'Apple Silicon permet à un Mac mini 24 Go de traiter des PDF par lots et un 70B quantifié en parallèle, sans CUDA ni WSL. Le M4 consomme environ 4 W au repos — adapté aux tâches Agent longues et à l'indexation nocturne.
Face à un PC du même segment, macOS affiche un taux de plantage très faible ; Gatekeeper et FileVault renforcent la sécurité d'un nœud de développement partagé à distance. Format compact et silence sans ventilateur réduisent aussi le coût d'exploitation 7×24. Si vous développez iOS/Flutter depuis Windows, migrer cet environnement d'expérimentation IA vers un Mac cloud coûte souvent moins cher qu'une nouvelle carte graphique.
Du parsing PDF à la mémoire Agent, de la validation 4 Go à l'orchestration de production, le matériel ne devrait pas plafonner vos essais — consultez nos offres et faites tourner la stack open source 2026 sur un Mac mini cloud en une fois.