À choisir pour
- Déploiement sur sa propre infrastructure
- Contrôle des poids et de l’exécution
Open-weight
gpt-oss-120bgpt-oss-120b est un modèle OpenAI orienté contrôle local avec la variante open-weight la plus puissante. Il s’adresse surtout aux organisations équipées pour exploiter un H100. La fiche le présente avec 131 072 jetons de contexte, et 131 072 jetons de sortie maximale, via Responses et Batch selon la fiche ; déploiement autonome possible. Il faut le comparer sur des cas réels avant toute migration.
Disponibilité sur chatgptfrancais.org : page informative — ce modèle n’est pas proposé dans le chatbot du site.
Verdict
Analyse éditoriale — choisissez gpt-oss-120b lorsque votre priorité est assistant interne hébergé sur infrastructure privée et que son profil de inférence contrôlée par l’exploitant correspond au produit. Écartez-le si une option moins coûteuse satisfait les mêmes évaluations, si l’endpoint imposé ne convient pas, ou si vous avez besoin d’une modalité que la fiche ne liste pas.
Données issues de la fiche OpenAI, contrôlées le 2026-08-10. « OpenAI ne publie pas » signifie que la valeur n’apparaît pas dans cette source, sans estimation de notre part.
| Identifiant | gpt-oss-120b |
|---|---|
| Entrées | texte |
| Sorties | texte |
| Fenêtre de contexte | 131 072 jetons |
| Sortie maximale | 131 072 jetons |
| Knowledge cutoff | 1er juin 2024 |
| Endpoint | Responses et Batch selon la fiche ; déploiement autonome possible |
| Raisonnement | Effort faible, moyen ou élevé |
| Outils et fonctions | function calling · code interpreter · web search · MCP |
| Prix publié | Aucun tarif d’inférence OpenAI n’est publié ; l’exploitant supporte ses coûts d’infrastructure. |
Le premier différenciateur est contrôle local avec la variante open-weight la plus puissante. OpenAI documente 131 072 jetons de contexte, 131 072 jetons en sortie et les modalités d’entrée texte. Ces chiffres décrivent une capacité technique ; ils ne prouvent pas, à eux seuls, la qualité sur un corpus français ou un métier particulier.
gpt-oss-120b passe par Responses et Batch selon la fiche ; déploiement autonome possible. Les capacités listées incluent function calling, code interpreter, web search, MCP. Cette combinaison détermine l’architecture possible : session persistante, requête asynchrone, traitement par lot ou composant spécialisé ne sont pas interchangeables.
Du point de vue éditorial, son intérêt tient à assistant interne hébergé sur infrastructure privée. La sélection doit pourtant arbitrer matériel, sécurité et coût total. Un modèle plus puissant peut coûter trop cher pour un flux simple ; un modèle économique peut déplacer la dépense vers les reprises manuelles et la gestion des erreurs.
Ce scénario vérifie gpt-oss-120b sur sa promesse centrale sans confondre démonstration et production. L’équipe doit comparer les erreurs, la latence et le coût au modèle témoin.
Le modèle apporte ici un premier traitement, tandis que l’opérateur garde la décision. Cette séparation réduit le risque d’automatiser une conclusion insuffisamment fondée.
Le périmètre fermé permet de construire une évaluation reproductible. Il révèle si le gain de débit justifie le modèle avant d’élargir le domaine.
Cette utilisation transforme le choix de gpt-oss-120b en décision mesurée. Elle évite de migrer sur le seul argument d’une fiche technique ou d’un prix facial.
| Modèle | Positionnement | Contexte | Endpoint | Prix |
|---|---|---|---|---|
| gpt-oss-120b | Grand modèle à poids ouverts pouvant tenir sur un GPU H100. | 131 072 jetons | Responses et Batch selon la fiche ; déploiement autonome possible | Aucun tarif d’inférence OpenAI n’est publié ; l’exploitant supporte ses coûts d’infrastructure. |
| gpt-oss-20b | Modèle à poids ouverts de taille moyenne orienté faible latence. | 131 072 jetons | Responses et Batch selon la fiche ; déploiement autonome possible | Aucun tarif d’inférence OpenAI n’est publié ; l’exploitant supporte ses coûts d’infrastructure. |
| GPT-5.4 | Modèle généraliste plus abordable pour le code et le travail professionnel. | 1 050 000 jetons | Responses, Chat Completions et Batch | Entrée 2,50 $, cache 0,25 $, sortie 15 $ par million de jetons. |
| GPT-5.3-Codex | Modèle actif spécialisé dans le code agentique. | 400 000 jetons | Responses | Entrée 1,75 $, cache 0,175 $, sortie 14 $ par million de jetons. |
Analyse éditoriale — gpt-oss-120b est le meilleur candidat lorsque assistant interne hébergé sur infrastructure privée domine la décision. gpt-oss-20b constitue le premier témoin à tester, tandis que GPT-5.4 permet de mesurer le compromis opposé. Conservez le modèle qui atteint le seuil qualité avec la marge de coût et de latence acceptable.
Coût et déploiement
Pour déployer gpt-oss-120b, partez de l’endpoint Responses et Batch selon la fiche ; déploiement autonome possible, fixez un budget par requête à partir du tarif publié et journalisez la consommation sans conserver de données sensibles inutiles. Versionnez prompts, schémas et jeux d’évaluation. Lors d’une migration, rejouez le même trafic sur gpt-oss-20b et GPT-5.4, puis comparez qualité, latence, erreurs d’outil et coût total. Analyse éditoriale : une bascule progressive avec seuil de repli est plus sûre qu’un remplacement global.
Limites
Au 2026-08-10, la fiche OpenAI indique : Aucun tarif d’inférence OpenAI n’est publié ; l’exploitant supporte ses coûts d’infrastructure. Le coût final dépend aussi du volume réellement envoyé, du cache disponible, des outils appelés et de l’infrastructure qui entoure le modèle.
gpt-oss-120b dispose de la valeur suivante sur sa fiche officielle : 131 072 jetons. La sortie maximale est 131 072 jetons. Une grande fenêtre ne garantit pas que toutes les informations auront le même poids ; le découpage et les évaluations restent nécessaires.
L’endpoint documenté est : Responses et Batch selon la fiche ; déploiement autonome possible. Il faut éviter de supposer qu’un endpoint voisin est compatible. Les équipes doivent valider streaming, outils, formats de sortie et gestion d’erreur dans l’API effectivement annoncée.
La comparaison la plus utile porte sur gpt-oss-20b et GPT-5.4. Le bon choix dépend de matériel, sécurité et coût total, pas du seul numéro de version. Notre recommandation est une analyse éditoriale, à confirmer sur vos données.
Les caractéristiques et tarifs ci-dessus proviennent uniquement des pages OpenAI indiquées. Les choix de modèle, cas d’usage et conseils de migration sont signalés comme analyses éditoriales. chatgptfrancais.org est indépendant et sans affiliation à OpenAI.