Guide provider
Ollama et modeles locaux
Connecter Ollama et des modeles locaux a Hermes Agent: installation, configuration, detection de contexte et depannage. Guide independant, structure et verifiable.
Sur cette page
Introduction
Hermes Agent supporte les modeles de langage executes localement via plusieurs backends. Ollama est le plus simple: detection automatique, zero configuration. D'autres backends comme vLLM, llama.cpp, SGLang et LM Studio sont egalement compatibles via l'interface OpenAI standard.
Faire tourner un modele localement offre trois avantages: confidentialite (vos donnees ne quittent pas votre machine), cout zero a l'usage (pas de frais d'API), et independance (pas de dependance a un service cloud).
Ollama: la solution zero config
Installer Ollama
Attention : La commande ci-dessous telecharge et execute un script depuis Internet directement dans votre shell. Avant de l'executer, inspectez le contenu du script avec
curl -fsSL https://ollama.com/install.sh | lessou ouvrez l'URL dans un navigateur. Verifiez que la source est officielle et que la connexion est HTTPS. Pour annuler, fermez le terminal avant d'executer la commande.
# Linux / macOS
curl -fsSL https://ollama.com/install.sh | sh
# Ou via le package manager
# macOS: brew install ollama
# Linux: snap install ollamaTelecharger un modele
ollama pull llama3.2 # modele leger, bon pour les tests
ollama pull qwen2.5-coder # specialise code
ollama pull mistral # usage general
ollama pull deepseek-r1 # raisonnementConnecter Hermes Agent
Ollama est detecte automatiquement. Lancez simplement:
hermes modelHermes Agent scanne http://localhost:11434 et affiche les modeles Ollama disponibles. Selectionnez celui que vous voulez utiliser par defaut.
Si Ollama n'est pas detecte, verifiez qu'il tourne:
ollama serve # demarre le serveur (si pas deja lance)
ollama list # liste les modeles installes
curl http://localhost:11434/api/tags # verifie l'APIChanger de modele Ollama
En cours de session, utilisez /model pour basculer entre les modeles Ollama installes.
Autres backends locaux
vLLM: inference GPU haute performance
# Lancez vLLM avec l'interface OpenAI compatible
vllm serve meta-llama/Llama-3.1-8B-Instruct --port 8000
# Dans Hermes Agent
hermes model
# Choisissez "Custom endpoint" et entrez http://localhost:8000/v1llama.cpp / llama-server: CPU et Metal
# Lancez le serveur
llama-server -m modele.gguf --port 8080
# Dans Hermes Agent
hermes model
# Choisissez "Custom endpoint" et entrez http://localhost:8080/v1SGLang: serving rapide avec RadixAttention
python -m sglang.launch_server --model meta-llama/Llama-3.1-8B-Instruct --port 30000
# Dans Hermes Agent
hermes model
# Choisissez "Custom endpoint" et entrez http://localhost:30000/v1LM Studio: application desktop
- Installez LM Studio
- Telechargez un modele dans l'interface
- Demarrez le serveur local (onglet "Developer")
- Dans Hermes Agent:
hermes model, choisissez "LM Studio"
Configuration de la fenetre de contexte
Pour les modeles locaux, la detection automatique de la fenetre de contexte peut etre incorrecte. Ajustez-la manuellement dans config.yaml:
model:
default: "llama3.2"
context_window: 131072 # fenetre reelle du modeleVerifiez la fenetre de contexte de votre modele dans sa documentation (Ollama: ollama show <modele>, vLLM: configuration du serveur).
Custom Endpoint: configuration manuelle
Pour tout backend compatible OpenAI, utilisez "Custom endpoint":
hermes model
# Choisissez "Custom endpoint"
# Entrez l'URL de base (ex: http://localhost:8000/v1)
# Entrez une cle API si necessaire (ou laissez vide)La configuration est sauvegardee dans config.yaml et reapparait dans le menu /model.
Named Custom Providers
Vous pouvez nommer vos endpoints custom pour les retrouver facilement:
# Dans config.yaml
model:
default: "mon-modele"
providers:
mon-serveur:
base_url: "http://192.168.1.100:8000/v1"
api_key: "sk-local"Verifier la connexion
hermes status
hermes chat -q "Bonjour, quel modele es-tu ?"
hermes prompt-size # verifie la fenetre de contexteDepannage
Ollama non detecte
ollama serve # verifiez que le serveur tourne
curl http://localhost:11434/api/tags # testez l'APISi Ollama tourne sur une autre machine, utilisez un Custom Endpoint avec l'IP distante.
Modele local trop lent
- Essayez un modele plus petit (ex:
llama3.2:3bau lieu dellama3.1:70b) - Pour Ollama, verifiez que l'acceleration GPU est active:
ollama run <modele> --verbose - Pour vLLM, augmentez le nombre de GPUs ou reduisez la taille du modele
Erreur de contexte (prompt trop long)
Ajustez context_window dans config.yaml a la valeur reelle de votre modele. Les modeles locaux ont souvent des fenetres plus petites que les modeles cloud (4K a 32K tokens pour les modeles legers).
WSL2: probleme de reseau
Sous Windows avec WSL2, Ollama peut ne pas etre accessible depuis Hermes Agent. Solutions:
- Lancez Ollama dans la meme distribution WSL2 que Hermes Agent
- Ou configurez le port forwarding WSL2
- Ou utilisez l'IP de la machine Windows hote comme Custom Endpoint
Sources
- Documentation officielle Hermes Agent (https://hermes-agent.nousresearch.com/docs/)
- AI Providers (https://hermes-agent.nousresearch.com/docs/integrations/providers)
- CLI commands reference (https://hermes-agent.nousresearch.com/docs/reference/cli-commands)
- Depot NousResearch/hermes-agent, commit b4f8c491
Liens internes proposes
Preuves et limites
Architecture, corpus officiel et observations publiques sont ingérés au build. Une validation humaine reste nécessaire pour les affirmations publiées.