OpenAI updated several evaluation benchmarks for its GPT-6 Astra model after publishing a blog post on September 3 that experienced deployment issues and a brief retraction. [1]
Mengqi Yuan from the XLANG Lab at the University of Hong Kong presented OSWorld 2.0, a benchmark consisting of 108 long-horizon, real-world computer-use workflows spanning 31 self-hosted websites and professional desktop applications. [2] An OpenAI spokesperson stated that fixes were made to the launch blog to ensure numbers represented the best estimate of available model performance for meaningful user comparisons. [3] Researchers from the Stanford Intelligent Systems Laboratory and Stanford Trustworthy AI Lab suggested that the rapid changes in metrics indicate 'benchmaxxing,' a practice of maximizing scores by re-running evaluations with different conditions. [4]
The reported hallucination rate for GPT-6 Astra changed from 4.2% in early snapshots to 2% in a later version before reverting back to 4.2%. [5] Claude Fable 5.1, released less than 24 hours before the presentation, pushed OSWorld 2.0 partial-credit scores above 60% and binary completion above 45%. [6] The average task in OSWorld 2.0 requires more than 300 agent steps, and 69.6% of tasks take a skilled human over an hour to complete. [7]
The best system evaluated in the paper completes only 20.6% of OSWorld 2.0 tasks outright, with a partial-credit score of 54.8%. [8]
En qué se apoya
OpenAI updated several evaluation benchmarks for its GPT-6 Astra model after publishing a blog post on September 3 that experienced deployment issues and a brief retraction. · fortune.comEstados Unidos
Mengqi Yuan from the XLANG Lab at the University of Hong Kong presented OSWorld 2.0, a benchmark consisting of 108 long-horizon, real-world computer-use workflows spanning 31 self-hosted websites and professional desktop applications. · Snorkel AI
An OpenAI spokesperson stated that fixes were made to the launch blog to ensure numbers represented the best estimate of available model performance for meaningful user comparisons. · fortune.comEstados Unidos
Researchers from the Stanford Intelligent Systems Laboratory and Stanford Trustworthy AI Lab suggested that the rapid changes in metrics indicate 'benchmaxxing,' a practice of maximizing scores by re-running evaluations with different conditions. · fortune.comEstados Unidos
The reported hallucination rate for GPT-6 Astra changed from 4.2% in early snapshots to 2% in a later version before reverting back to 4.2%. · fortune.comEstados Unidos
Claude Fable 5.1, released less than 24 hours before the presentation, pushed OSWorld 2.0 partial-credit scores above 60% and binary completion above 45%. · Snorkel AI
The average task in OSWorld 2.0 requires more than 300 agent steps, and 69.6% of tasks take a skilled human over an hour to complete. · Snorkel AI
The best system evaluated in the paper completes only 20.6% of OSWorld 2.0 tasks outright, with a partial-credit score of 54.8%. · Snorkel AI
El único que pudimos ubicar publica desde Estados Unidos. 1 no se pudieron ubicar por su dirección. Ninguno es un organismo oficial: esa parte se apoya en el reporte, no en el documento o la transcripción subyacente.
Procedencia del artículo · 8 fuentes · v 002worldrecordwritingfiling
Cómo se hizo esta pieza:escrita por TruthFoundry News Desk, una persona de IA declarada,
en la mesa de redacciónel Saturday, September 5, 2026.
Sus fuentes las colocó la redacción, nunca se dan por supuestas. Abra cada paso para ver más; cada hash dice qué cubre.
1 · El mundo2 editores informaron de los hechos
Lo que declararon es la lista numerada de fuentes de arriba.Por qué estas fuentes y no otras
Cómo las eligió la redacción
No elegimos editores. La redacción lee el registro de hechos del suceso, agrupa los reportes que llevan la misma afirmación y escribe a partir de ese grupo. Dentro de él, lo que sube es una puntuación de interés: cuánta atención atrae una afirmación en el registro, y qué tan reciente es. Eso mide el INTERÉS, no la verdad ni la autoridad, y una afirmación muy difundida no es más verdadera. Una pieza se retiene salvo que al menos 2 orígenes INDEPENDIENTES la lleven, donde los medios que publican el mismo teletipo cuentan como un solo origen, no muchos. Por ahora no ingerimos transcripciones, expedientes ni comunicados directamente, así que salvo que un organismo oficial aparezca en la lista de arriba, esta pieza se apoya en el reporte sobre el documento y no en el documento mismo.
Desde dónde publican
El único que pudimos ubicar publica desde Estados Unidos. 1 no se pudieron ubicar por su dirección. Ninguno es un organismo oficial: esa parte se apoya en el reporte, no en el documento o la transcripción subyacente.
2 · El registroextrajo esos informes en filas de hechos firmadas
IA · búsqueda semántica
Los hechos en que se apoya esta pieza fueron seleccionados por búsqueda semántica sobre el registro: representaciones de IA emparejan la consulta de cada sección con filas de hechos por significado, no por palabras clave.
Esta redacción leyó los hechos por la puerta pública del registro, y la puerta firmó la lectura.El recibo de lectura no se capturó para esta revisión temprana.
3 · La redacciónescrita como TruthFoundry News Desk por un gran modelo de lenguaje
IA · generación de noticias
La línea automática escribió esto como TruthFoundry News Desk usando un gran modelo de lenguaje a las 2026-09-05T06:24Z.
Los prompts, literales
Los prompts y el texto archivado que aparecen abajo se reproducen exactamente como fueron escritos y firmados. Son el registro, así que se conservan en el idioma en que fueron archivados.
Instrucción del sistema (las reglas de anclaje)
El encargo: contrato de voz de la persona + las instrucciones permanentes de esta redacción + los hechos numerados
4 · El archivoescrita en el registro permanente
Una vez publicada, la pieza se escribe en el registro permanente. Su recibo - la prueba de que no ha cambiado desde entonces - está en Integridad, abajo, y el botón de allí la vuelve a comprobar en su propio navegador.
Integridad
Hash del contenido (SHA-256)17c6a6623aa2a97a22b9b08a9656148c3d00e13a03386ce262cc6d35bafa74a1
Base del hashtitular + bajada + texto + el JSON canónico de las citas, exactamente como se archivó
Reciboesta revisión es anterior al registro de recibos; la fila archivada vive en el registro