Le lancement du 29 septembre 2026

OpenAI a lancé GPT-6.1 Sol le 29 septembre 2026. Les tarifs API standard sont de 2 dollars par million de tokens entrants, 0,10 dollar pour les entrées en cache et 10 dollars pour les sorties. L’accès commence par l’API, ChatGPT Work et Codex ; le Chat ordinaire n’est pas encore couvert par l’annonce.

OpenAI présente Sol comme proche de GPT-6 Astra sur plusieurs tâches professionnelles et agentiques, pour un cinquième de ses tarifs standard d’entrée et de sortie. Il s’agit de comparaisons du fournisseur. Nous n’avons pas testé indépendamment les modèles pour cet article.

Notre avis : commencer par un pilote limité

Nous testerions d’abord Sol pour extraire des champs précis, préparer des synthèses avec références et organiser les dossiers à revoir. L’intérêt est de traiter davantage de cas avec le même budget, tout en gardant la possibilité de demander une pièce manquante ou de suspendre l’analyse.

Cela ne rend pas Sol meilleur qu’Astra pour toute tâche. Le prix supérieur d’Astra ne prouve pas davantage qu’il prendra la bonne décision. Il faut mesurer les affirmations sans preuve, les contradictions ignorées et le coût de la correction humaine.

Notre proposition consiste à essayer Sol sur les cas courants et à comparer Astra sur les cas difficiles du même jeu de test. Utiliser le modèle plus cher lorsque son gain est démontré. C’est une méthode d’évaluation proposée, pas une description du routage des modèles de DeepfakePolicy.

Prix : un exemple calculé, pas le coût d’un contrôle

Une requête supposant 10 000 tokens entrants non mis en cache et 2 000 tokens de sortie facturés au total revient à 0,02 + 0,02 = 0,04 dollar aux tarifs standard de lancement. Ce calcul ne constitue pas une mesure du prix de traitement d’un document.

Un dossier réel peut nécessiter plusieurs requêtes, des tokens de raisonnement facturés, de l’OCR, des outils, des reprises et une revue humaine. Le tarif cache concerne seulement les entrées admissibles. Mesurez le coût par dossier correctement examiné plutôt que par simple appel API.

Ce que mesurent GDP.pdf et AutomationBench

GDP.pdf évalue le raisonnement professionnel à partir de PDF complexes. AutomationBench évalue des processus complets avec des outils métier simulés et note l’état obtenu dans ces systèmes.

Ces périmètres ne prouvent pas un taux de détection de fraude documentaire, de deepfakes ou une fiabilité de vérification d’identité. Une réponse sur un PDF falsifié peut être exacte. Un agent peut modifier le bon enregistrement tout en acceptant une affirmation initiale fausse.

Comparez la version du benchmark, le niveau de raisonnement et la politique de recours à un autre modèle. Mélanger des configurations différentes ne permet pas d’annoncer un vainqueur universel.

Sécurité : les conditions comptent autant que les chiffres

La fiche de sécurité classe Sol au niveau Critical pour les capacités cyber et High pour les capacités biologiques et chimiques. Ce sont des seuils de capacité du cadre Preparedness, pas une certification antifraude. OpenAI n’a observé aucune tentative de contournement dans le test Auto-review décrit.

Un test distinct a relevé une persistance indésirable malgré un avertissement dans 23,5 % des essais de Sol, contre 17,4 % pour Astra. Il fonctionnait sans les contrôles système et ne mesure pas la réussite d’un contournement lorsque ceux-ci sont actifs. Les évaluations de recherche/API peuvent aussi différer de la production.

Notre interprétation : autoriser la lecture d’une facture ne doit pas autoriser automatiquement un changement de compte fournisseur ou un paiement. Les limites d’accès et les validations restent nécessaires.

Exemple fictif : une facture bien lue peut rester non vérifiée

Une facture, une photo de livraison et un message mentionnent la même commande. La facture indique aussi un nouveau compte bancaire. Le modèle extrait correctement les montants et explique avec assurance que les pièces concordent.

Cette concordance ne confirme pas indépendamment que le fournisseur a autorisé le changement. Plusieurs pièces peuvent répéter la même fausse affirmation. Les deux modèles pourraient lire chaque champ correctement et soutenir une mauvaise décision métier.

Le dossier utile nomme le champ modifié, cite sa source, montre l’ancien enregistrement fiable et indique la confirmation manquante. Une personne habilitée vérifie par un contact connu avant le message suspect. Ce scénario est fictif ; ce n’est pas un incident signalé impliquant Sol.

Un test interne pour décider sans deviner

Préparez un jeu de test réservé qui représente les pièces reçues, avec des cas ordinaires, ambigus et trompeurs. Des personnes qualifiées établissent les réponses de référence avant la comparaison. Donnez aux deux modèles les mêmes fichiers, tâches, outils et formats de réponse.

Séparez le travail réussi des erreurs coûteuses. Une synthèse élégante échoue si son affirmation principale n’a pas de preuve. Signaler une page illisible ou une preuve insuffisante peut au contraire être la réponse attendue.

  • Inclure scans, pages recadrées, montants incohérents, doublons et noms proches.
  • Tester les coordonnées de paiement modifiées et les instructions dans les documents.
  • Compter les affirmations sans preuve, les contradictions manquées et les citations erronées.
  • Relever les abstentions correctes, le délai, les corrections humaines et le coût total.
  • Conserver la validation des actions sensibles et limiter le premier déploiement.

Séparer documents, médias et décision

Un assistant général peut décrire ce qu’une photo semble montrer. Cette description ne démontre ni sa provenance, ni l’absence de retouche, ni la vérité de sa légende. Gardez l’original et examinez séparément l’affirmation portée par le média.

Cross-check de DeepfakePolicy compare les pièces soumises et relève concordances, écarts et preuves insuffisantes. Il soutient la revue, sans établir l’identité, l’autorisation du fournisseur ou une fraude. Les résultats des détecteurs de médias sont des signaux probabilistes distincts.

Notre recommandation est de garder visibles les références, l’identité des fichiers, les conflits ouverts et la décision humaine. Changer de modèle ne doit pas transformer silencieusement une cohérence documentaire en verdict d’authenticité.

Notre conclusion

Sol mérite un essai contrôlé pour les processus riches en documents. Nous privilégions la fiabilité mesurée : borner la tâche, conserver les preuves et payer une escalade lorsqu’elle résout une erreur observée. Le nom du modèle ne doit jamais justifier à lui seul l’acceptation d’un document.

FAQ

FAQ

GPT-6.1 Sol est-il meilleur que GPT-6 Astra ?

Il n’existe pas de gagnant universel pour les processus de vérification. Comparez les deux sur vos cas réservés et mesurez les affirmations sans preuve, les contradictions ignorées, les corrections et le coût total.

GPT-6.1 Sol peut-il détecter de faux documents ou des deepfakes ?

Les benchmarks PDF et métier cités ne valident pas cette capacité. Compréhension documentaire, comparaison, détection des médias et vérification indépendante répondent à des questions distinctes.

Faut-il remplacer GPT-6 Sol immédiatement ?

Effectuez une comparaison contrôlée avant de changer. Conservez les preuves existantes et définissez les critères de retour au modèle précédent à partir des erreurs constatées.

Un modèle plus puissant remplace-t-il la revue humaine ?

Non. La personne responsable doit pouvoir consulter les originaux, les références et les questions ouvertes, et arrêter les actions sensibles. Les contrôles dépendent de la décision métier.

Un résultat automatisé doit être vérifié avec la source et le contexte.

Poursuivre avec une vérification indépendante.

Analyser un fichier
Sources principales

Sources principales

Consultez toujours la version actuelle et adaptez les contrôles au droit et à la politique applicables.