Better tools. Better news.
jueves, 3 de septiembre de 2026 · UTC
212 de 750 en esta edición
IA

ExBind Benchmark Diagnoses Visual-to-Executable Mapping Errors

ExBind benchmark isolates visual-to-executable correspondence errors in multimodal coding models.

TruthFoundry Desk
del registro de hechos
Compartir en X
Se apoya en 6 fuentes verificadas de 2 editores.
ExBind is a controlled diagnostic benchmark designed to isolate the visual-to-executable correspondence layer between semantic localization and action execution in multimodal coding and editing systems. [1] Researchers demonstrated that Vision-Language Models (VLMs) often rewrite imperfect text into more plausible forms instead of transcribing it faithfully. [2] Qwen2.5-VL-3B achieved 98.4% candidate validity but only 76.4% exact accuracy on the benchmark. [3] Evaluation of 15 systems spanning general-purpose VLMs, OCR-specialized VLMs, and traditional OCR pipelines showed that general-purpose VLMs degrade by up to 6.9 points in Word Error Rate under perturbation. [4] Probing the Qwen3-VL-4B model layer-by-layer identified that rewriting fires only when a perturbed word's final layer FFN representation stays close to the original encoding. [5] The authors introduced FaithC4, a multilingual perturbation benchmark consisting of 1,455 single-page documents in English, Chinese, and Korean. [6]
En qué se apoya
  1. ExBind is a controlled diagnostic benchmark designed to isolate the visual-to-executable correspondence layer between semantic localization and action execution in multimodal coding and editing systems. · takara.ai
  2. Researchers demonstrated that Vision-Language Models (VLMs) often rewrite imperfect text into more plausible forms instead of transcribing it faithfully. · arXiv.org
  3. Qwen2.5-VL-3B achieved 98.4% candidate validity but only 76.4% exact accuracy on the benchmark. · takara.ai
  4. Evaluation of 15 systems spanning general-purpose VLMs, OCR-specialized VLMs, and traditional OCR pipelines showed that general-purpose VLMs degrade by up to 6.9 points in Word Error Rate under perturbation. · arXiv.org
  5. Probing the Qwen3-VL-4B model layer-by-layer identified that rewriting fires only when a perturbed word's final layer FFN representation stays close to the original encoding. · arXiv.org
  6. The authors introduced FaithC4, a multilingual perturbation benchmark consisting of 1,455 single-page documents in English, Chinese, and Korean. · arXiv.org
No pudimos ubicar a ninguno por su dirección. Ninguno es un organismo oficial: esa parte se apoya en el reporte, no en el documento o la transcripción subyacente.
Procedencia del artículo · 6 fuentes · v 001worldrecordwritingfiling

Cómo se hizo esta pieza: escrita por TruthFoundry News Desk, una persona de IA declarada, en la mesa de redacción el Thursday, September 3, 2026. Sus fuentes las colocó la redacción, nunca se dan por supuestas. Abra cada paso para ver más; cada hash dice qué cubre.

1 · El mundo2 editores informaron de los hechos
Lo que declararon es la lista numerada de fuentes de arriba.
Por qué estas fuentes y no otras
Cómo las eligió la redacción
No elegimos editores. La redacción lee el registro de hechos del suceso, agrupa los reportes que llevan la misma afirmación y escribe a partir de ese grupo. Dentro de él, lo que sube es una puntuación de interés: cuánta atención atrae una afirmación en el registro, y qué tan reciente es. Eso mide el INTERÉS, no la verdad ni la autoridad, y una afirmación muy difundida no es más verdadera. Una pieza se retiene salvo que al menos 2 orígenes INDEPENDIENTES la lleven, donde los medios que publican el mismo teletipo cuentan como un solo origen, no muchos. Por ahora no ingerimos transcripciones, expedientes ni comunicados directamente, así que salvo que un organismo oficial aparezca en la lista de arriba, esta pieza se apoya en el reporte sobre el documento y no en el documento mismo.
Desde dónde publican
No pudimos ubicar a ninguno por su dirección. Ninguno es un organismo oficial: esa parte se apoya en el reporte, no en el documento o la transcripción subyacente.
2 · El registroextrajo esos informes en filas de hechos firmadas
IA · búsqueda semántica
Los hechos en que se apoya esta pieza fueron seleccionados por búsqueda semántica sobre el registro: representaciones de IA emparejan la consulta de cada sección con filas de hechos por significado, no por palabras clave.
Esta redacción leyó los hechos por la puerta pública del registro, y la puerta firmó la lectura. El recibo de lectura no se capturó para esta revisión temprana.
3 · La redacciónescrita como TruthFoundry News Desk por un gran modelo de lenguaje
IA · generación de noticias
La línea automática escribió esto como TruthFoundry News Desk usando un gran modelo de lenguaje a las 2026-09-03T06:46Z.
Los prompts, literales
Instrucción del sistema (las reglas de anclaje)

El encargo: contrato de voz de la persona + las instrucciones permanentes de esta redacción + los hechos numerados
4 · El archivoescrita en el registro permanente
Una vez publicada, la pieza se escribe en el registro permanente. Su recibo - la prueba de que no ha cambiado desde entonces - está en Integridad, abajo, y el botón de allí la vuelve a comprobar en su propio navegador.
Integridad
Hash del contenido (SHA-256)b3af8b517dc8a1c1bc11cd0fd3f3dda35ad3b3c8e7b8ae106c465f8beabceeba
Base del hashtitular + bajada + texto + el JSON canónico de las citas, exactamente como se archivó
Reciboesta revisión es anterior al registro de recibos; la fila archivada vive en el registro
Legible por máquinala prueba completa, JSON
Verificar

Una firma prueba quién archivó esto y que no ha cambiado desde entonces. Nunca hace verdadera una afirmación.

A continuación en esta ediciónUS Navy Campaign in Latin America Kills 220 in One Year