Nuevos modelos de IA desafían la IA a gran escala – el doble de velocidad y posible entrenar en una computadora portátil
Nuevo modelo de IA es el doble de rápido y cabe en una computadora portátil.
Cuando el tamaño deja de ser lo determinante
Existe una creencia arraigada de que los avances en IA requieren mil millones de parámetros, enormes centros de datos y presupuestos que pocas organizaciones pueden ni siquiera soñar. Esa creencia está desmoronándose, y esta semana llegaron dos pruebas más contundentes de ello.
Según Hugging Face Blog, NeoMME — una nueva familia de modelos base en tamaños de 260 millones y 800 millones de parámetros — logra combinar procesamiento de imagen y texto en una única red transformadora, sin codificadores de imagen previamente entrenados por separado ni decodificadores de texto. Puede sonar como un detalle técnico, pero es en realidad una cuestión de principio arquitectónico: en lugar de unir modelos especializados parcheados, la imagen y el texto se procesan por exactamente el mismo camino computacional.
Concretamente, esto significa que las imágenes se dividen en una cuadrícula de bloques de 32×32 píxeles y se alimentan lado a lado con tokens de texto en un codificador transformador bidireccional. El modelo también soporta resolución de imagen dinámica, lo que significa que ajusta automáticamente el número de tokens dependiendo de cuán densa en información sea una imagen, una asignación inteligente de recursos que evita trabajo computacional innecesario.
El doble de velocidad, una fracción del tamaño del índice
En pruebas prácticas en una unidad de procesamiento gráfico NVIDIA L40S, la variante de 260M maneja alrededor de 51 páginas de documentos por segundo con un tamaño de imagen de 2.048×2.048 píxeles, aproximadamente el doble de velocidad que el sistema comparable ColModernVBERT, según Hugging Face Blog.
Aún más impresionante es lo que el equipo logró con el almacenamiento. Mediante agrupación jerárquica de tokens y cuantización asimétrica, reduce el índice de búsqueda de aproximadamente 1,5 megabytes a solo 6 kilobytes por documento. No es una mejora pequeña, es un orden de magnitud que cambia lo que es posible desplegar incluso con infraestructura limitada. La ventana de contexto de 16.384 tokens — suficiente para dos imágenes de 4K completas — permite que el modelo maneje documentos complejos y densos en información sin perder el hilo.
Multilingüismo es algo que lleva el modelo en el nombre. Para el reconocimiento de documentos en contextos europeos y asiáticos, donde el texto puede mezclarse libremente con tablas, formularios y gráficos, es una característica que importa realmente.
350 millones de parámetros y una computadora portátil son suficientes
Paralelamente al lanzamiento de NeoMME, Hugging Face publica una guía que muestra algo casi provocativamente simple: que es posible mejorar significativamente el desempeño de un pequeño modelo de lenguaje, sin grandes recursos ni infraestructura avanzada.
Mediante optimización de política relativa de grupo — una forma de aprendizaje por refuerzo — mejoraron el modelo LFM2.5-350M de 22,6 a 29,7 por ciento en el referente IFStruct, que específicamente mide qué tan bien un modelo sigue requisitos de esquema como JSON o YAML. Todo el entrenamiento requiere solo 500 ejemplos de entrenamiento y 100 pasos de entrenamiento, y cabe en la versión gratuita de los servicios en la nube Colab o Kaggle.
Lo que hace esto particularmente interesante no es solo los números, es la accesibilidad. El código de entrenamiento está abierto en GitHub. La evaluación se realizó localmente en una MacBook Pro con procesador Apple M5 Max a través de la herramienta abierta llama.cpp. Nada en la cadena requiere una cuenta empresarial o una factura de nube cara.
Salidas estructuradas — que un modelo devuelva JSON con el esquema correcto en lugar de texto disuelto — es uno de los requisitos más comunes en sistemas reales. Sin embargo, es un área que los referentes tradicionales miden mal. IFStruct llena esa brecha, y los resultados sugieren que el aprendizaje por refuerzo puede ser uno de los métodos más eficientes en recursos para especializar un modelo pequeño en un área de uso concreto.
La misma historia, dos ángulos diferentes
NeoMME y LFM2.5-350M son técnicamente proyectos completamente diferentes, pero llevan el mismo mensaje: la IA abierta se democratiza más rápido de lo que muchos pensaban. Un modelo que procesa páginas de documentos en tiempo real con índices de tamaño kilobyte. Otro que se entrena a capacidad competitiva en hardware que cualquiera ya tiene en casa.
Ya no es una pregunta sobre si los modelos pequeños y abiertos pueden desafiar a los grandes cerrados. Es una pregunta sobre qué tan rápido el ecosistema alrededor de ellos madura.