Actif dans le catalogue OpenAI

Open-weight

gpt-oss-20b

gpt-oss-20b

gpt-oss-20b est un modèle OpenAI orienté déploiement open-weight plus léger et faible latence. Il s’adresse surtout aux équipes qui veulent personnaliser sans infrastructure extrême. La fiche le présente avec 131 072 jetons de contexte, et 131 072 jetons de sortie maximale, via Responses et Batch selon la fiche ; déploiement autonome possible. Il faut le comparer sur des cas réels avant toute migration.

Données vérifiées le 10 août 2026Analyse éditoriale indépendanteFiche officielle OpenAI

Disponibilité sur chatgptfrancais.org : page informative — ce modèle n’est pas proposé dans le chatbot du site.

Verdict

Faut-il choisir gpt-oss-20b ?

Analyse éditoriale — choisissez gpt-oss-20b lorsque votre priorité est agent spécialisé exécuté près des données et que son profil de inférence contrôlée par l’exploitant correspond au produit. Écartez-le si une option moins coûteuse satisfait les mêmes évaluations, si l’endpoint imposé ne convient pas, ou si vous avez besoin d’une modalité que la fiche ne liste pas.

À choisir pour

  • Déploiement sur sa propre infrastructure
  • Contrôle des poids et de l’exécution

À écarter lorsque

  • Projet sans infrastructure ML
  • Audio ou image natifs

Spécifications de gpt-oss-20b

Données issues de la fiche OpenAI, contrôlées le 2026-08-10. « OpenAI ne publie pas » signifie que la valeur n’apparaît pas dans cette source, sans estimation de notre part.

Identifiantgpt-oss-20b
Entréestexte
Sortiestexte
Fenêtre de contexte131 072 jetons
Sortie maximale131 072 jetons
Knowledge cutoff1er juin 2024
EndpointResponses et Batch selon la fiche ; déploiement autonome possible
RaisonnementEffort faible, moyen ou élevé
Outils et fonctionsfunction calling · code interpreter · web search · MCP
Prix publiéAucun tarif d’inférence OpenAI n’est publié ; l’exploitant supporte ses coûts d’infrastructure.

Capacités et différences utiles

01

Le premier différenciateur est déploiement open-weight plus léger et faible latence. OpenAI documente 131 072 jetons de contexte, 131 072 jetons en sortie et les modalités d’entrée texte. Ces chiffres décrivent une capacité technique ; ils ne prouvent pas, à eux seuls, la qualité sur un corpus français ou un métier particulier.

02

gpt-oss-20b passe par Responses et Batch selon la fiche ; déploiement autonome possible. Les capacités listées incluent function calling, code interpreter, web search, MCP. Cette combinaison détermine l’architecture possible : session persistante, requête asynchrone, traitement par lot ou composant spécialisé ne sont pas interchangeables.

03

Du point de vue éditorial, son intérêt tient à agent spécialisé exécuté près des données. La sélection doit pourtant arbitrer matériel, sécurité et coût total. Un modèle plus puissant peut coûter trop cher pour un flux simple ; un modèle économique peut déplacer la dépense vers les reprises manuelles et la gestion des erreurs.

Cas d’usage concrets

Qualifier puis traiter un flux réel

Entrée
Un lot représentatif lié à agent spécialisé exécuté près des données, accompagné des règles métier et du format attendu.
Sortie
Une réponse structurée, contrôlable et directement exploitable par le système aval.

Ce scénario vérifie gpt-oss-20b sur sa promesse centrale sans confondre démonstration et production. L’équipe doit comparer les erreurs, la latence et le coût au modèle témoin.

Assister un opérateur sans masquer les preuves

Entrée
Les éléments disponibles, le contexte utilisateur et les sources autorisées pour une tâche de inférence contrôlée par l’exploitant.
Sortie
Une proposition argumentée qui conserve les références utiles à la validation humaine.

Le modèle apporte ici un premier traitement, tandis que l’opérateur garde la décision. Cette séparation réduit le risque d’automatiser une conclusion insuffisamment fondée.

Automatiser un cas borné et mesurable

Entrée
Une entrée normalisée, des exemples acceptés ou refusés et un schéma de sortie strict autour de agent spécialisé exécuté près des données.
Sortie
Un résultat validable automatiquement, avec remontée des cas ambigus.

Le périmètre fermé permet de construire une évaluation reproductible. Il révèle si le gain de débit justifie le modèle avant d’élargir le domaine.

Comparer une migration sur trafic rejoué

Entrée
Un échantillon anonymisé des requêtes actuelles, les sorties de référence et les contraintes de service.
Sortie
Un tableau qualité-coût-latence et une liste des régressions à corriger.

Cette utilisation transforme le choix de gpt-oss-20b en décision mesurée. Elle évite de migrer sur le seul argument d’une fiche technique ou d’un prix facial.

gpt-oss-20b face aux alternatives

ModèlePositionnementContexteEndpointPrix
gpt-oss-20bModèle à poids ouverts de taille moyenne orienté faible latence.131 072 jetonsResponses et Batch selon la fiche ; déploiement autonome possibleAucun tarif d’inférence OpenAI n’est publié ; l’exploitant supporte ses coûts d’infrastructure.
gpt-oss-120bGrand modèle à poids ouverts pouvant tenir sur un GPU H100.131 072 jetonsResponses et Batch selon la fiche ; déploiement autonome possibleAucun tarif d’inférence OpenAI n’est publié ; l’exploitant supporte ses coûts d’infrastructure.
GPT-5.4 miniPetit modèle adapté au code, au computer use et aux sous-agents.400 000 jetonsResponses, Chat Completions et BatchEntrée 0,75 $, cache 0,075 $, sortie 4,50 $ par million de jetons.
GPT-5 nanoVersion GPT-5 rapide et économique.400 000 jetonsResponses, Chat Completions et BatchEntrée 0,05 $, cache 0,005 $, sortie 0,40 $ par million de jetons.

Analyse éditoriale — gpt-oss-20b est le meilleur candidat lorsque agent spécialisé exécuté près des données domine la décision. gpt-oss-120b constitue le premier témoin à tester, tandis que GPT-5.4 mini permet de mesurer le compromis opposé. Conservez le modèle qui atteint le seuil qualité avec la marge de coût et de latence acceptable.

Coût et déploiement

Passer de la fiche à la production

Pour déployer gpt-oss-20b, partez de l’endpoint Responses et Batch selon la fiche ; déploiement autonome possible, fixez un budget par requête à partir du tarif publié et journalisez la consommation sans conserver de données sensibles inutiles. Versionnez prompts, schémas et jeux d’évaluation. Lors d’une migration, rejouez le même trafic sur gpt-oss-120b et GPT-5.4 mini, puis comparez qualité, latence, erreurs d’outil et coût total. Analyse éditoriale : une bascule progressive avec seuil de repli est plus sûre qu’un remplacement global.

Limites

Ce que la fiche ne garantit pas

  • La date de connaissances publiée est 1er juin 2024. Toute information postérieure doit venir d’une source fournie au modèle ou d’un outil autorisé ; le nom du modèle ne garantit jamais une connaissance en temps réel.
  • Effort faible, moyen ou élevé. Cette indication ne remplace pas une mesure de justesse. Les réponses plausibles mais fausses, les formats invalides et les appels d’outils incomplets doivent être traités comme des cas normaux du système.
  • La fiche officielle ne promet ni performance sur vos données françaises, ni niveau de service applicatif, ni conformité métier. dimensionner mémoire, débit, observabilité et isolation avant une mise en production. Cette recommandation est notre analyse éditoriale, non une garantie d’OpenAI.

Questions fréquentes sur gpt-oss-20b

Quel est le prix de gpt-oss-20b ?

Au 2026-08-10, la fiche OpenAI indique : Aucun tarif d’inférence OpenAI n’est publié ; l’exploitant supporte ses coûts d’infrastructure. Le coût final dépend aussi du volume réellement envoyé, du cache disponible, des outils appelés et de l’infrastructure qui entoure le modèle.

Quelle est la fenêtre de contexte de gpt-oss-20b ?

gpt-oss-20b dispose de la valeur suivante sur sa fiche officielle : 131 072 jetons. La sortie maximale est 131 072 jetons. Une grande fenêtre ne garantit pas que toutes les informations auront le même poids ; le découpage et les évaluations restent nécessaires.

Quelle API utiliser avec gpt-oss-20b ?

L’endpoint documenté est : Responses et Batch selon la fiche ; déploiement autonome possible. Il faut éviter de supposer qu’un endpoint voisin est compatible. Les équipes doivent valider streaming, outils, formats de sortie et gestion d’erreur dans l’API effectivement annoncée.

Quelle alternative comparer à gpt-oss-20b ?

La comparaison la plus utile porte sur gpt-oss-120b et GPT-5.4 mini. Le bon choix dépend de matériel, sécurité et coût total, pas du seul numéro de version. Notre recommandation est une analyse éditoriale, à confirmer sur vos données.

Méthode, fraîcheur et sources

Les caractéristiques et tarifs ci-dessus proviennent uniquement des pages OpenAI indiquées. Les choix de modèle, cas d’usage et conseils de migration sont signalés comme analyses éditoriales. chatgptfrancais.org est indépendant et sans affiliation à OpenAI.

Retour au catalogue des modèles OpenAI →