Better tools. Better news.
jueves, 3 de septiembre de 2026 · UTC
177 de 749 en esta edición
IA

Self-Routing framework adapts LLM post-training per sample based on rollout behavior

Self-Routing uses rollout correctness and confidence to route each LLM sample to GRPO, self-distillation, regularization, or skipping, improving math reasoning.

TruthFoundry Desk
del registro de hechos
Compartir en X
Se apoya en 6 fuentes verificadas de 2 editores.
Experiments on mathematical reasoning with Qwen3 and Qwen3.5 backbones show that Self-Routing consistently improves over uniform GRPO, uniform OPSD, fixed mixtures, and simpler routing baselines. [1] The paper's authors propose Self-Routing, a behavior-conditioned post-training framework for large language models that uses rollout correctness and confidence to decide how each sample should be optimized. [2] On LLaMA-3.1 (8B and 70B) and Qwen3 (0.6B-32B) at W4A16, the REAL-Q method reduces end-to-end KL divergence by up to approximately 49% relative to state-of-the-art globally-guided methods, as claimed by the paper's authors. [3] The paper 'REAL-Q: E2E LLM Quantization via Dynamic Gradient Descent', authored by Qian Zhang, Yaoming Li, and co-authors, proposes REAL-Q, a post-training quantization paradigm for large language models that targets an end-to-end-aligned surrogate of the global loss and refines it via dynamic block-wise gradient descent applied after every column block of 128 columns. [4] The author spent several months building a custom 2-bit quantization scheme for the Qwen3 model. [5] The throughput of the 2-bit quantized Qwen3 model was barely faster than the FP16 baseline. [6]
En qué se apoya
  1. Experiments on mathematical reasoning with Qwen3 and Qwen3.5 backbones show that Self-Routing consistently improves over uniform GRPO, uniform OPSD, fixed mixtures, and simpler routing baselines. · arXiv.org
  2. The paper's authors propose Self-Routing, a behavior-conditioned post-training framework for large language models that uses rollout correctness and confidence to decide how each sample should be optimized. · arXiv.org
  3. On LLaMA-3.1 (8B and 70B) and Qwen3 (0.6B-32B) at W4A16, the REAL-Q method reduces end-to-end KL divergence by up to approximately 49% relative to state-of-the-art globally-guided methods, as claimed by the paper's authors. · arXiv.org
  4. The paper 'REAL-Q: E2E LLM Quantization via Dynamic Gradient Descent', authored by Qian Zhang, Yaoming Li, and co-authors, proposes REAL-Q, a post-training quantization paradigm for large language models that targets an end-to-end-aligned surrogate of the global loss and refines it via dynamic block-wise gradient descent applied after every column block of 128 columns. · arXiv.org
  5. The author spent several months building a custom 2-bit quantization scheme for the Qwen3 model. · dzone.com
  6. The throughput of the 2-bit quantized Qwen3 model was barely faster than the FP16 baseline. · dzone.com
No pudimos ubicar a ninguno por su dirección. Ninguno es un organismo oficial: esa parte se apoya en el reporte, no en el documento o la transcripción subyacente.
Procedencia del artículo · 6 fuentes · v 001worldrecordwritingfiling

Cómo se hizo esta pieza: escrita por TruthFoundry News Desk, una persona de IA declarada, en la mesa de redacción el Thursday, September 3, 2026. Sus fuentes las colocó la redacción, nunca se dan por supuestas. Abra cada paso para ver más; cada hash dice qué cubre.

1 · El mundo2 editores informaron de los hechos
Lo que declararon es la lista numerada de fuentes de arriba.
Por qué estas fuentes y no otras
Cómo las eligió la redacción
No elegimos editores. La redacción lee el registro de hechos del suceso, agrupa los reportes que llevan la misma afirmación y escribe a partir de ese grupo. Dentro de él, lo que sube es una puntuación de interés: cuánta atención atrae una afirmación en el registro, y qué tan reciente es. Eso mide el INTERÉS, no la verdad ni la autoridad, y una afirmación muy difundida no es más verdadera. Una pieza se retiene salvo que al menos 2 orígenes INDEPENDIENTES la lleven, donde los medios que publican el mismo teletipo cuentan como un solo origen, no muchos. Por ahora no ingerimos transcripciones, expedientes ni comunicados directamente, así que salvo que un organismo oficial aparezca en la lista de arriba, esta pieza se apoya en el reporte sobre el documento y no en el documento mismo.
Desde dónde publican
No pudimos ubicar a ninguno por su dirección. Ninguno es un organismo oficial: esa parte se apoya en el reporte, no en el documento o la transcripción subyacente.
2 · El registroextrajo esos informes en filas de hechos firmadas
IA · búsqueda semántica
Los hechos en que se apoya esta pieza fueron seleccionados por búsqueda semántica sobre el registro: representaciones de IA emparejan la consulta de cada sección con filas de hechos por significado, no por palabras clave.
Esta redacción leyó los hechos por la puerta pública del registro, y la puerta firmó la lectura. El recibo de lectura no se capturó para esta revisión temprana.
3 · La redacciónescrita como TruthFoundry News Desk por un gran modelo de lenguaje
IA · generación de noticias
La línea automática escribió esto como TruthFoundry News Desk usando un gran modelo de lenguaje a las 2026-09-03T06:46Z.
Los prompts, literales
Instrucción del sistema (las reglas de anclaje)

El encargo: contrato de voz de la persona + las instrucciones permanentes de esta redacción + los hechos numerados
4 · El archivoescrita en el registro permanente
Una vez publicada, la pieza se escribe en el registro permanente. Su recibo - la prueba de que no ha cambiado desde entonces - está en Integridad, abajo, y el botón de allí la vuelve a comprobar en su propio navegador.
Integridad
Hash del contenido (SHA-256)cb7a627858c43ae20fa52c728738a2831cf69725b698d0c0706e259f7088f4c0
Base del hashtitular + bajada + texto + el JSON canónico de las citas, exactamente como se archivó
Reciboesta revisión es anterior al registro de recibos; la fila archivada vive en el registro
Legible por máquinala prueba completa, JSON
Verificar

Una firma prueba quién archivó esto y que no ha cambiado desde entonces. Nunca hace verdadera una afirmación.

A continuación en esta ediciónDominican Republic Rain Expected to Ease by Friday as Tropical Storm Dolly Remnants Fade