De introductie op 29 september 2026

OpenAI introduceerde GPT-6.1 Sol op 29 september 2026. De standaard API-prijzen zijn 2 dollar per miljoen invoertokens, 0,10 dollar voor gecachte invoer en 10 dollar voor uitvoer. De toegang begint via de API, ChatGPT Work en Codex; volgens de aankondiging volgt gewone Chat-toegang later.

OpenAI plaatst Sol bij verschillende professionele en agenttaken dicht bij GPT-6 Astra, tegen een vijfde van de standaard invoer- en uitvoerprijzen. Dit zijn vergelijkingen van de leverancier. Wij hebben de modellen voor dit artikel niet onafhankelijk getest.

Ons oordeel: begin met een afgebakende proef

Wij zouden Sol eerst testen voor het uitlezen van concrete velden, samenvattingen met bronverwijzingen en het voorbereiden van een beoordelingslijst. De kans is om met hetzelfde budget meer dossiers te behandelen, terwijl ontbrekend bewijs een reden blijft om te stoppen of aanvullende stukken te vragen.

Daarmee is Sol niet voor elke taak beter dan Astra. Astra’s hogere prijs bewijst evenmin dat het de juiste beslissing zal ondersteunen. Meet onbewezen uitspraken, gemiste tegenstrijdigheden en kosten inclusief menselijke correcties.

Ons voorstel: probeer Sol voor gewone gevallen en vergelijk Astra op de moeilijke gevallen uit dezelfde testset. Gebruik het duurdere model waar een gemeten verbetering de kosten rechtvaardigt. Dit is een evaluatieadvies, geen beschrijving van de modelroutering in DeepfakePolicy.

Prijzen: een rekenvoorbeeld voor tokens

Een veronderstelde aanvraag met 10.000 niet-gecachte invoertokens en in totaal 2.000 betaalde uitvoertokens kost 0,02 + 0,02 = 0,04 dollar tegen de standaard introductietarieven. Dit is een berekening, geen meting van de kosten van een documentcontrole.

Een werkelijk dossier kan meerdere aanvragen, betaalde redeneertokens, OCR, hulpmiddelen, herhalingen en menselijke beoordeling vereisen. Het cachetarief geldt alleen voor invoer die daarvoor in aanmerking komt. Vergelijk de kosten per correct beoordeeld dossier in plaats van per losse API-aanvraag.

Wat GDP.pdf en AutomationBench meten

GDP.pdf toetst professioneel redeneren op basis van complexe PDF-documenten. AutomationBench toetst volledige bedrijfsprocessen met gesimuleerde hulpmiddelen en beoordeelt de uiteindelijke toestand van de bedrijfsgegevens.

Die opzet bewijst geen detectiepercentage voor documentfraude, deepfakes of identiteitsverificatie. Een vraag over een vervalste PDF kan juist worden beantwoord. Een proces kan het juiste record aanpassen en toch een onjuiste uitgangsbewering accepteren.

Vergelijk alleen scores met de benchmarkversie, redeneerinstelling en het beleid voor terugval naar een ander model erbij. Verschillende configuraties vormen geen algemene ranglijst van betrouwbaarheid.

Veiligheidsresultaten vragen om context

OpenAI’s systeemkaart behandelt Sol als Critical voor cybercapaciteiten en High voor biologische en chemische capaciteiten. Dit zijn capaciteitsdrempels in het Preparedness-kader, geen certificering voor fraudebeoordeling. In de beschreven Auto-review-test zag OpenAI geen omzeilingspogingen.

Een andere test vond ongewenst doorgaan na een waarschuwing in 23,5% van Sol’s runs, tegenover 17,4% bij Astra. Die test gebruikte geen systeemcontroles en meet niet hoe vaak een omzeiling met zulke controles zou slagen. Onderzoeks- en API-evaluaties kunnen bovendien afwijken van productie.

Onze interpretatie: toestemming om een factuur te lezen mag niet automatisch toestemming worden om een leveranciersrekening te wijzigen of te betalen. Toegangsgrenzen en goedkeuring van acties blijven nodig.

Fictief factuurvoorbeeld: goed gelezen is nog niet geverifieerd

Een factuur, een leveringsfoto en een bericht noemen dezelfde bestelling. De factuur bevat ook een nieuwe bankrekening. Het model leest de bedragen correct en legt overtuigend uit dat de stukken overeenkomen.

Dat bevestigt niet onafhankelijk dat de leverancier de rekeningwijziging heeft goedgekeurd. Overeenkomende bestanden kunnen dezelfde onjuiste bewering herhalen. Beide modellen zouden elk veld correct kunnen lezen en toch een verkeerde zakelijke beslissing ondersteunen.

Een bruikbaar beoordelingsdossier benoemt het gewijzigde veld, citeert de bron, toont het eerdere vertrouwde record en laat de ontbrekende bevestiging zien. Een bevoegde medewerker controleert via een al eerder bekend contact. Dit voorbeeld is fictief en geen gemeld Sol-incident.

Een eigen testset voor de modelkeuze

Maak een apart gehouden testset die past bij de ontvangen bestanden, met normale, onduidelijke en misleidende gevallen. Deskundige beoordelaars bepalen vooraf de referentieantwoorden. Beide modellen krijgen dezelfde bestanden, taak, hulpmiddelen en antwoordstructuur.

Meet goed werk en kostbare fouten afzonderlijk. Een fraaie samenvatting faalt wanneer de belangrijkste uitspraak geen bron heeft. Het melden van een onleesbare pagina of onvoldoende bewijs kan juist correct zijn.

  • Neem scans, bijgesneden pagina’s, afwijkende bedragen, dubbele records en vergelijkbare namen op.
  • Test gewijzigde betaalgegevens en instructies die in bronbestanden staan.
  • Tel onbewezen uitspraken, gemiste tegenstrijdigheden en verkeerde bronverwijzingen.
  • Registreer correct afzien van een conclusie, verwerkingstijd, menselijke correcties en totale kosten.
  • Houd ingrijpende acties achter goedkeuring en begin met een beperkte uitrol.

Houd documentcontrole en deepfake-detectie apart

Een algemene assistent kan beschrijven wat een foto lijkt te tonen. Dat stelt de herkomst, eventuele bewerking of waarheid van het bijschrift niet vast. Bewaar het originele bestand en controleer de mediabewering apart van de documenttekst.

DeepfakePolicy Cross-check vergelijkt aangeleverde stukken en toont overeenkomsten, verschillen en onvoldoende bewijs. Het ondersteunt beoordeling, maar stelt identiteit, bevoegdheid van een leverancier of fraude niet vast. Resultaten van mediadetectors zijn afzonderlijke probabilistische signalen.

Ons advies is om bronverwijzingen, bestandsidentiteit, open conflicten en het menselijke besluit zichtbaar te houden. Een modelwisseling mag een consistentiebevinding niet stilzwijgend veranderen in een uitspraak over echtheid.

Onze conclusie

Sol verdient een gecontroleerde proef voor processen met veel documenten. Wij kiezen voor gemeten betrouwbaarheid: beperk de taak, bewaar het bewijs en betaal voor opschaling als die een waargenomen fout oplost. De modelnaam mag nooit de reden zijn om een document als echt te accepteren.

FAQ

FAQ

Is GPT-6.1 Sol beter dan GPT-6 Astra?

Voor document- en fraudebeoordeling bestaat geen algemene winnaar. Vergelijk beide op uw eigen apart gehouden gevallen en meet onbewezen uitspraken, gemiste conflicten, correcties en totale kosten.

Kan GPT-6.1 Sol vervalste documenten of deepfakes detecteren?

De genoemde PDF- en workflowbenchmarks valideren dat niet. Documentbegrip, consistentievergelijking, mediadetectie en onafhankelijke verificatie beantwoorden verschillende vragen.

Moet GPT-6 Sol meteen worden vervangen?

Voer eerst een gecontroleerde vergelijking uit. Bewaar bestaande bewijsrecords en stel op basis van waargenomen fouten criteria vast om terug te keren naar het eerdere model.

Vervangt een sterker model de menselijke beoordeling?

Nee. De verantwoordelijke moet de originelen, bronverwijzingen en open vragen kunnen bekijken en ingrijpende acties kunnen stoppen. Controles volgen de zakelijke beslissing.

Geautomatiseerde resultaten vereisen controle van bron en context.

Ga verder met onafhankelijke verificatie.

Controleer een bestand
Primaire bronnen

Primaire bronnen

Controleer de actuele bron en pas de stappen aan het toepasselijke recht en beleid aan.