Rechercher

Commence à saisir pour chercher.

    Sur cette page

    Introduction

    Hermes Agent supporte les modeles de langage executes localement via plusieurs backends. Ollama est le plus simple: detection automatique, zero configuration. D'autres backends comme vLLM, llama.cpp, SGLang et LM Studio sont egalement compatibles via l'interface OpenAI standard.

    Faire tourner un modele localement offre trois avantages: confidentialite (vos donnees ne quittent pas votre machine), cout zero a l'usage (pas de frais d'API), et independance (pas de dependance a un service cloud).

    Ollama: la solution zero config

    Installer Ollama

    Attention : La commande ci-dessous telecharge et execute un script depuis Internet directement dans votre shell. Avant de l'executer, inspectez le contenu du script avec curl -fsSL https://ollama.com/install.sh | less ou ouvrez l'URL dans un navigateur. Verifiez que la source est officielle et que la connexion est HTTPS. Pour annuler, fermez le terminal avant d'executer la commande.

    Commande ou exempleBASH
    # Linux / macOS
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Ou via le package manager
    # macOS: brew install ollama
    # Linux: snap install ollama

    Telecharger un modele

    Commande ou exempleBASH
    ollama pull llama3.2        # modele leger, bon pour les tests
    ollama pull qwen2.5-coder   # specialise code
    ollama pull mistral         # usage general
    ollama pull deepseek-r1     # raisonnement

    Connecter Hermes Agent

    Ollama est detecte automatiquement. Lancez simplement:

    Commande ou exempleBASH
    hermes model

    Hermes Agent scanne http://localhost:11434 et affiche les modeles Ollama disponibles. Selectionnez celui que vous voulez utiliser par defaut.

    Si Ollama n'est pas detecte, verifiez qu'il tourne:

    Commande ou exempleBASH
    ollama serve            # demarre le serveur (si pas deja lance)
    ollama list             # liste les modeles installes
    curl http://localhost:11434/api/tags   # verifie l'API

    Changer de modele Ollama

    En cours de session, utilisez /model pour basculer entre les modeles Ollama installes.

    Autres backends locaux

    vLLM: inference GPU haute performance

    Commande ou exempleBASH
    # Lancez vLLM avec l'interface OpenAI compatible
    vllm serve meta-llama/Llama-3.1-8B-Instruct --port 8000
    
    # Dans Hermes Agent
    hermes model
    # Choisissez "Custom endpoint" et entrez http://localhost:8000/v1

    llama.cpp / llama-server: CPU et Metal

    Commande ou exempleBASH
    # Lancez le serveur
    llama-server -m modele.gguf --port 8080
    
    # Dans Hermes Agent
    hermes model
    # Choisissez "Custom endpoint" et entrez http://localhost:8080/v1

    SGLang: serving rapide avec RadixAttention

    Commande ou exempleBASH
    python -m sglang.launch_server --model meta-llama/Llama-3.1-8B-Instruct --port 30000
    
    # Dans Hermes Agent
    hermes model
    # Choisissez "Custom endpoint" et entrez http://localhost:30000/v1

    LM Studio: application desktop

    1. Installez LM Studio
    2. Telechargez un modele dans l'interface
    3. Demarrez le serveur local (onglet "Developer")
    4. Dans Hermes Agent: hermes model, choisissez "LM Studio"

    Configuration de la fenetre de contexte

    Pour les modeles locaux, la detection automatique de la fenetre de contexte peut etre incorrecte. Ajustez-la manuellement dans config.yaml:

    Commande ou exempleYAML
    model:
      default: "llama3.2"
      context_window: 131072    # fenetre reelle du modele

    Verifiez la fenetre de contexte de votre modele dans sa documentation (Ollama: ollama show <modele>, vLLM: configuration du serveur).

    Custom Endpoint: configuration manuelle

    Pour tout backend compatible OpenAI, utilisez "Custom endpoint":

    Commande ou exempleBASH
    hermes model
    # Choisissez "Custom endpoint"
    # Entrez l'URL de base (ex: http://localhost:8000/v1)
    # Entrez une cle API si necessaire (ou laissez vide)

    La configuration est sauvegardee dans config.yaml et reapparait dans le menu /model.

    Named Custom Providers

    Vous pouvez nommer vos endpoints custom pour les retrouver facilement:

    Commande ou exempleYAML
    # Dans config.yaml
    model:
      default: "mon-modele"
      providers:
        mon-serveur:
          base_url: "http://192.168.1.100:8000/v1"
          api_key: "sk-local"

    Verifier la connexion

    Commande ou exempleBASH
    hermes status
    hermes chat -q "Bonjour, quel modele es-tu ?"
    hermes prompt-size          # verifie la fenetre de contexte

    Depannage

    Ollama non detecte

    Commande ou exempleBASH
    ollama serve                   # verifiez que le serveur tourne
    curl http://localhost:11434/api/tags   # testez l'API

    Si Ollama tourne sur une autre machine, utilisez un Custom Endpoint avec l'IP distante.

    Modele local trop lent

    • Essayez un modele plus petit (ex: llama3.2:3b au lieu de llama3.1:70b)
    • Pour Ollama, verifiez que l'acceleration GPU est active: ollama run <modele> --verbose
    • Pour vLLM, augmentez le nombre de GPUs ou reduisez la taille du modele

    Erreur de contexte (prompt trop long)

    Ajustez context_window dans config.yaml a la valeur reelle de votre modele. Les modeles locaux ont souvent des fenetres plus petites que les modeles cloud (4K a 32K tokens pour les modeles legers).

    WSL2: probleme de reseau

    Sous Windows avec WSL2, Ollama peut ne pas etre accessible depuis Hermes Agent. Solutions:

    • Lancez Ollama dans la meme distribution WSL2 que Hermes Agent
    • Ou configurez le port forwarding WSL2
    • Ou utilisez l'IP de la machine Windows hote comme Custom Endpoint

    Sources

    Liens internes proposes

    Sources structurées

    Preuves et limites

    Architecture, corpus officiel et observations publiques sont ingérés au build. Une validation humaine reste nécessaire pour les affirmations publiées.