Configuration du modèle
Vue d'ensemble
La page de configuration du modèle sert à gérer les fournisseurs LLM et les paramètres des modèles. Le côté APP prend en charge la configuration simultanée de plusieurs fournisseurs ; le système bascule automatiquement le format d'API et la détection de capacités en fonction du modèle sélectionné.

Fournisseurs pris en charge
| Fournisseur | Format d'API | Description |
|---|---|---|
| Anthropic | anthropic | Modèles de la série Claude |
| OpenAI | openai | Modèles des séries GPT / o |
| DeepSeek | openai | DeepSeek-chat / reasoner |
| Qwen (Tongyi Qianwen) | openai | Qwen-plus / Qwen-max |
| Gemini | openai | Série Google Gemini |
| Personnalisé | openai / anthropic | Services tiers compatibles avec le format OpenAI ou Anthropic |
Paramètres de configuration
| Paramètre | Description |
|---|---|
| Sélection du fournisseur | Sélectionnez le fournisseur LLM dans la liste déroulante |
| Clé API | Clé API du fournisseur (stockage chiffré) |
| Base URL | Adresse du point de terminaison de l'API (obligatoire pour les fournisseurs personnalisés) |
| apiFormat | Format du protocole d'API : anthropic ou openai |
| Sélection du modèle | Sélectionnez un modèle dans la liste des modèles disponibles du fournisseur |
| tokensRespLimit | Nombre maximal de tokens de sortie par tour |
Marqueurs de capacités des modèles
Le système détecte automatiquement les capacités des modèles via resolveCapabilities, ce qui influe sur le traitement des entrées multimodales :
| Capacité | Description | Impact |
|---|---|---|
| vision | Compréhension d'images | Accepte ou non les entrées d'images |
| document | Compréhension de documents | Accepte ou non les entrées de documents tels que les PDF |
| audio | Compréhension audio | Accepte ou non les entrées audio |
| tool_use | Appel d'outils | Prend en charge ou non le function calling |
Fenêtre de contexte
Taille par défaut de la fenêtre de contexte de chaque modèle :
| Modèle | Fenêtre de contexte |
|---|---|
| Claude Sonnet 4 / Opus 4 / Claude 4 | 200 000 tokens |
| GPT-4o / GPT-4o-mini / GPT-4-turbo | 128 000 tokens |
| GPT-4.1 | 1 000 000 tokens |
| o3 / o4-mini | 200 000 tokens |
| DeepSeek-chat / DeepSeek-reasoner | 64 000 tokens |
| Qwen-plus / Qwen-max | 128 000 tokens |
Pour la liste complète des modèles, reportez-vous à Liste des modèles pris en charge.
Guide d'utilisation
Comment configurer un modèle
- Ouvrez l'APP → menu des paramètres à gauche → Modèle
- Dans la liste des fournisseurs, sélectionnez le fournisseur LLM que vous souhaitez utiliser (par exemple Anthropic)
- Saisissez la clé API fournie par ce fournisseur
- (Facultatif) Si vous utilisez un service tiers compatible, modifiez la Base URL en remplaçant par l'adresse du point de terminaison fournie par le prestataire
- Sélectionnez un modèle précis dans la liste déroulante des modèles (par exemple Claude Sonnet 4)
- Cliquez sur Enregistrer
Remarque : la clé API est stockée localement sous forme chiffrée et n'est pas transférée vers le cloud. Ne partagez jamais votre clé API avec autrui et ne la soumettez jamais à un dépôt de code.
Comment changer de modèle
Une fois plusieurs fournisseurs configurés, vous pouvez à tout moment changer le modèle actuellement utilisé. Après le changement, la conversation suivante utilisera le nouveau modèle. L'historique des conversations existantes n'est pas affecté.
Recommandations de choix de modèle
Différents scénarios conviennent à différents modèles ; voici les combinaisons recommandées :
| Scénario d'utilisation | Modèle recommandé | Raison |
|---|---|---|
| Conversations quotidiennes et tâches légères | GPT-4o-mini / Qwen-plus | Réponse rapide, faible coût |
| Raisonnement complexe et analyse de documents longs | Claude Opus 4 / Claude Sonnet 4 | Fortes capacités de raisonnement, contexte long de 200K, prise en charge des entrées document |
| Développement et débogage de code | DeepSeek-chat / Claude Sonnet 4 | Capacités de compréhension du code remarquables |
| Contexte ultra-long (dépôt de code entier) | GPT-4.1 | Fenêtre de contexte de 1M de tokens |
| Besoin de compréhension d'images | Claude Sonnet 4 / GPT-4o | Prise en charge de la capacité vision |
| Sensibilité aux coûts | Qwen-plus / DeepSeek-chat | Prix le plus bas |
| Besoin de raisonnement approfondi (mathématiques/logique) | o3 / DeepSeek-reasoner | Modèles à chaîne de raisonnement, mais DeepSeek-reasoner ne prend pas en charge l'appel d'outils |
Astuce : si vous ne savez pas lequel choisir, il est conseillé de commencer par Claude Sonnet 4 — il offre des performances équilibrées en matière de raisonnement, de code, d'appel d'outils et de multimodalité.
Impact réel de la fenêtre de contexte pour l'utilisateur
La fenêtre de contexte détermine la quantité de contenu que l'Agent peut « mémoriser » au cours d'une même conversation :
| Taille de la fenêtre | Équivaut à environ | Scénarios adaptés |
|---|---|---|
| 64K tokens | ~100 pages de texte brut ou ~5 fichiers de code moyens | Conversations courtes, opérations sur un seul fichier |
| 128K tokens | ~200 pages de texte brut ou ~10 fichiers de code | Projets de complexité moyenne, opérations multi-fichiers |
| 200K tokens | ~300 pages de texte brut ou ~15 fichiers de code | Projets complexes, longues conversations, analyse de documents PDF |
| 1M tokens | ~1500 pages de texte brut ou ~70 fichiers de code | Analyse de très grands dépôts de code, documents de la taille d'un livre entier |
Lorsque le contenu de la conversation approche la limite de la fenêtre, le système déclenche automatiquement la compression du contexte, qui conserve intelligemment les informations les plus importantes.
Impact de tokensRespLimit
tokensRespLimit contrôle le nombre maximal de tokens de chaque réponse de l'Agent par tour :
| Valeur définie | Impact |
|---|---|
| Trop petite (par exemple 500) | La réponse de l'Agent risque d'être tronquée ; les analyses complexes ou la génération de long code seront incomplètes |
| Modérée (par exemple 4096, valeur par défaut recommandée) | Équilibre entre l'exhaustivité de la réponse et la vitesse de réponse |
| Trop grande (par exemple 32000) | L'Agent peut fournir des réponses très longues, mais cela augmente le temps d'attente et le coût |
Conseil : conservez simplement la valeur par défaut. Si vous rencontrez fréquemment des réponses tronquées, vous pouvez l'augmenter modérément.
Questions fréquentes
Clé API invalide
- Vérifiez que la clé a été copiée correctement (attention aux espaces au début et à la fin)
- Vérifiez que le fournisseur correspondant à la clé est correctement sélectionné
- Vérifiez que la clé n'a pas expiré ou été révoquée
Délai de requête dépassé
- Vérifiez la connexion réseau
- Si vous utilisez une Base URL personnalisée, vérifiez que l'adresse est accessible
- Certains modèles peuvent répondre plus lentement en cas de forte charge ; réessayez ultérieurement
Qualité de réponse du modèle insuffisante
- Essayez de basculer vers un modèle plus puissant (par exemple, passez de GPT-4o-mini à Claude Sonnet 4)
- Vérifiez si tokensRespLimit est réglé sur une valeur trop faible
- Optimisez vos prompts en fournissant des instructions plus précises
Documents connexes
- Liste des modèles pris en charge — Matrice complète des capacités des modèles
- Compression du contexte en 5 couches — Stratégie de gestion de la fenêtre de contexte
