IA

Nuevo modelo de IA compacto rinde como los gigantes en código

Laguna S 2.1 tiene 118.000 millones de parámetros, pero en pruebas de programación de largo alcance compite con modelos varias veces más grandes y hasta redescubrió una prueba matemática abierta desde hace 50 años.

Por Administrador 3 min de lectura43 visualizaciones
Nuevo modelo de IA compacto rinde como los gigantes en código

Un nuevo modelo de inteligencia artificial llamado Laguna S 2.1 fue presentado como un avance en el desarrollo de sistemas capaces de sostener tareas complejas durante períodos prolongados y de razonar de forma eficiente antes de actuar.

Se trata de un modelo de tipo Mixture-of-Experts (MoE) con 118.000 millones de parámetros totales, de los cuales solo 8.000 millones se activan por token, y admite ventanas de contexto de hasta 1 millón de tokens, tanto en modo de razonamiento explícito como sin él. Su desarrollo, desde el inicio del entrenamiento hasta el lanzamiento, llevó menos de nueve semanas.

Rendimiento en pruebas de programación

En Terminal-Bench 2.1, un test que evalúa agentes conectados a un entorno real a través de una terminal para resolver tareas largas, el modelo obtuvo 70,2% de aciertos con el modo de razonamiento activado, ubicándose como el más competitivo dentro de su categoría de tamaño.

En DeepSWE v1.1, una prueba considerada más exigente porque sus tareas son difíciles de resolver parcialmente, Laguna S 2.1 alcanzó 40,4% de aciertos. Los desarrolladores aclaran que ese resultado se midió con su propio sistema de evaluación (pool) y no con la herramienta que usa el ranking oficial de DeepSWE (mini-swe-agent), aunque afirman que la comparación no los favorece de manera especial.

Como parte de la publicación, se liberaron las trayectorias completas de cada prueba de evaluación final para que puedan revisarse públicamente.

  • Terminal-Bench 2.1: 70,2% con razonamiento activado (60,4% sin él)
  • DeepSWE v1.1: 40,4% con razonamiento activado (16,5% sin él)

Casos de uso: desde un motor de navegador hasta una prueba matemática

Además de los benchmarks, se difundieron tres ejemplos de tareas reales resueltas por el modelo sin intervención humana:

  • En una sesión de 50 minutos y 181 pasos, el modelo construyó desde cero un motor de renderizado HTML/CSS en JavaScript puro —tokenizador, DOM, motor de cascada CSS, layout y renderizador—, y validó su funcionamiento comparando sus resultados con un navegador real usando Chromium sin interfaz.
  • Al optimizar el propio sistema de entrenamiento y evaluación del modelo, Laguna S 2.1 logró una mejora de velocidad del 5,2% y una reducción de casi 70% en el uso de memoria, tras detectar ineficiencias como concatenaciones de strings con complejidad cuadrática y copias redundantes de datos.
  • En matemática, el modelo redescubrió de forma independiente una prueba del problema Erdős #397, un enigma que había permanecido sin resolver durante más de 50 años hasta que GPT-5.2 Pro publicó una solución en enero de 2026. Dado que el conocimiento del modelo tiene un corte en noviembre de 2025, no pudo haber accedido a esa solución previa. La demostración que generó, además, usa una familia de ocho índices, estructuralmente distinta de la de seis índices hallada antes, lo que indica un desarrollo propio y no una repetición memorizada.

El modelo funciona con dos modos de razonamiento: apagado y "máximo" (activado por defecto), que ajusta automáticamente cuánto tiempo de cómputo dedica a cada problema. Se observaron sesiones de razonamiento coherente que se extendieron por varias horas y cientos de miles de tokens.

Limitaciones reconocidas

Los responsables del desarrollo señalaron varios puntos a mejorar en próximas versiones:

  • Dificultades para adaptarse a esquemas de herramientas de terceros que son similares pero no idénticos a los propios, lo que puede generar errores en el primer intento de uso.
  • Problemas ocasionales para generar JSON correctamente formateado en llamadas a herramientas anidadas.
  • Tendencia a extender demasiado el tiempo de razonamiento, en particular al resolver problemas de matemática de competencia.

Según explicaron, la mejora respecto a versiones anteriores de la familia Laguna no vino de un aumento de "inteligencia" bruta, sino de cambios de comportamiento: más verificación, menos conformismo con soluciones parciales y mayor persistencia antes de dar por terminada una tarea. Modelos previos solían declarar terminada una tarea con un test parcialmente aprobado o abandonar un enfoque poco antes de que funcionara; este no lo hace.

Laguna S 2.1 es una versión escalada de la familia Laguna XS, entrenada con los mismos datos que XS 2.1: los cambios respecto a esa versión anterior fueron de escala, ajustes en el código de entrenamiento y pequeñas modificaciones de método, sin datos nuevos. Es además el primer modelo de la serie cuyo entrenamiento por refuerzo se realizó en precisión FP8, lo que aceleró esa etapa del proceso. Ya comenzó el pre-entrenamiento de un modelo más grande de la misma familia.

Publicidad Wire-fin

Comentarios

Ingresá para comentar — leer es gratis, comentar también.

Todavía no hay comentarios. Sé el primero en opinar.

Notas relacionadas