gpt-oss-120b¶
Dans cet article
Information
gpt-oss-120b est un modèle à grande échelle avec des poids ouverts (open weights) d'OpenAI, conçu pour des tâches de haute performance nécessitant un raisonnement profond, une planification multi-étapes et une interaction complexe avec des outils. Le modèle contient 120 milliards de paramètres, dont environ 21 milliards sont activés par passage, offrant un équilibre entre puissance de calcul et efficacité. Grâce à des méthodes de quantification avancées et à l'optimisation, gpt-oss-120b peut être déployé sur du matériel serveur disposant de 70 Go ou plus de mémoire vidéo et supporte un déploiement local ou hybride évolutif.
Fonctionnalités principales de gpt-oss-120b¶
- Architecture évolutive avec activation conditionnelle : Le modèle contient 120 milliards de paramètres, mais grâce au mécanisme d'activation parcimonieuse (sparse activation), il n'active qu'environ 21 milliards de paramètres par requête. Cela réduit considérablement les besoins en mémoire et en ressources de calcul sans compromettre la qualité.
- Capacités d'agent avancées : gpt-oss-120b supporte un ensemble étendu d'outils, incluant l'exécution de code, la recherche web en temps réel, l'appel d'API et la génération de sorties strictement structurées (JSON, XML, etc.). Cela en fait une base idéale pour les agents autonomes et les systèmes automatisés complexes.
- Raisonnement adaptatif : Le modèle implémente un système flexible de niveaux de raisonnement — allant de réponses directes rapides à des chaînes de pensée multi-étapes (chain-of-thought) et des arbres de décision. Les utilisateurs peuvent contrôler la « profondeur de réflexion » selon la complexité de la tâche.
- Haute performance sur les benchmarks : gpt-oss-120b démontre des résultats comparables aux modèles propriétaires de niveau o3 et o4, particulièrement dans les tâches nécessitant de la logique, des mathématiques, de la programmation et une synthèse interdisciplinaire des connaissances.
- Prise en charge multilingue étendue : Le modèle est entraîné sur des données provenant de plus de 50 langues et peut fonctionner efficacement dans des contextes multilingues et multiculturels. Pour obtenir les meilleurs résultats, il est recommandé de spécifier explicitement la langue et le cadre culturel dans le prompt.
- Quantification efficace et compatibilité : Le support des formats MXFP4 et INT4 permet une réduction significative de l'utilisation de la mémoire et une accélération de la sortie sans perte substantielle de qualité. Le modèle est compatible avec les frameworks populaires tels que vLLM, GGUF et Hugging Face Transformers.
Fonctionnalités de déploiement¶
| ID | Nom du logiciel | Système d'exploitation compatible | VM | BM | VGPU | GPU | Min CPU (Cœurs) | Min RAM (GB) | Min HDD/SSD (GB) | Domaine personnalisé | Actif |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 415 | gpt-oss:120b | Ubuntu 22.04 | - | - | + | + | 16 | 128 | 240 | Non | COMMANDER |
- Le serveur Ollama charge et exécute le LLM en mémoire ;
- Open WebUI est déployé en tant qu'application web connectée au serveur Ollama ;
- Les utilisateurs interagissent avec le LLM via l'interface web d'Open WebUI, envoyant des requêtes et recevant des réponses ;
- Tous les calculs et le traitement des données s'effectuent localement sur le serveur. Les administrateurs peuvent configurer le LLM pour des tâches spécifiques via les outils OpenWebUI.
Prise en main après le déploiement de gpt-oss-120b¶
Après le paiement, une notification concernant la disponibilité du serveur sera envoyée à l'adresse e-mail enregistrée lors de la commande. Elle inclura l'adresse IP du VPS, l'identifiant et le mot de passe pour l'accès au serveur, ainsi qu'un lien vers le panneau de contrôle OpenWebUI. Les clients gèrent leur équipement via le Server Management Panel and API — Invapi.
- Les identifiants pour l'accès au serveur OS (par exemple, via SSH) seront envoyés dans l'e-mail reçu.
- Lien vers le panneau de contrôle Ollama avec l'interface web Open WebUI : dans la section webpanel sous l'onglet Configuration >> Tags du panneau de contrôle d'Invapi. Le lien exact, par exemple
https://gpt-oss<Server_ID_from_Invapi>.hostkey.in, est fourni dans l'e-mail envoyé lors de la livraison du serveur.
Lors de la première visite sur le lien webpanel, une page de bienvenue s'ouvrira. Cliquez sur le bouton Get started pour commencer la configuration.
Après avoir cliqué sur le lien de la section webpanel, une fenêtre de connexion Get started with Open WebUI s'ouvrira, où vous devrez créer un nom de compte administrateur, un e-mail et un mot de passe pour votre chatbot, puis appuyez sur le bouton Create Admin Account :

Attention
Après l'enregistrement du premier utilisateur, le système lui attribue automatiquement un rôle d'administrateur. Pour garantir la sécurité et le contrôle du processus d'inscription, toutes les demandes d'inscription ultérieures doivent être approuvées dans OpenWebUI depuis le compte administrateur.
Une fois l'enregistrement réussi, l'interface principale d'Open WebUI avec l'accès à Gpt-oss-20b s'ouvrira :

Remarque
Des informations détaillées sur l'utilisation du panneau de contrôle Ollama avec Open WebUI sont disponibles dans l'article AI Chatbot on Your Own Server.
Remarque
Pour un fonctionnement optimal avec le modèle gpt-oss-120b, il est recommandé d'utiliser un GPU avec au moins 70 Go de mémoire vidéo pour le modèle 120B. Pour un traitement efficace des contextes de code longs et des tâches d'agents complexes, nous recommandons l'utilisation de GPU avec 80 Go de mémoire vidéo. Des informations détaillées sur les principaux paramètres d'Ollama et d'Open WebUI sont disponibles dans la documentation développeur d'Ollama et dans la documentation développeur d'Open WebUI.
Recommandations d'utilisation
Pour maximiser l'efficacité du modèle gpt-oss 20B, il est recommandé de :
- Utiliser le modèle pour des tâches de raisonnement, y compris le traitement par chaîne de pensée (chain-of-thought). Le modèle supporte des niveaux de raisonnement ajustables : faible, moyen et élevé, qui se configurent via un prompt système.
- Utiliser les capacités d'agent intégrées du modèle telles que l'appel de fonctions (function calling), l'exécution de code Python et les sorties structurées.
- Employer le modèle pour des tâches de développement multi-étapes en exploitant ses capacités d'agent.
- Intégrer le modèle aux outils de développement existants via l'API, étant donné qu'il supporte le réglage (tuning) et fonctionne au format de réponse OpenAI Harmony. Le modèle est conçu pour un déploiement efficace avec une faible latence, y compris en local.
Commander un serveur avec gpt-oss-120b via l'API¶
Pour installer ce logiciel en utilisant l'API, suivez ces instructions.