El punto ciego de la industria de IA: Nadie sabe realmente si los modelos cumplen lo que prometen
Nuestras herramientas para evaluar IA ya están obsoletas – un joven de 25 años quiere cambiar eso.
El problema de medición que nadie quería hablar
Existe una verdad con la que la industria de IA ha convivido durante mucho tiempo pero rara vez ha expresado en voz alta: las herramientas que utilizamos para medir la capacidad de los modelos de IA están obsoletas. Muchas de ellas fueron construidas en una época en que "inteligente" significaba básicamente aprobar una prueba de conocimiento. La pregunta era: ¿puede el modelo recitar la respuesta correcta? No: ¿puede el modelo realmente hacer algo valioso?
Esa brecha – entre lo que las herramientas de medición prueban y lo que las empresas realmente necesitan – se ha vuelto cada vez más difícil de ignorar. Y es precisamente esa brecha la que Vals, fundada tan recientemente como en 2024, ahora apunta a cerrar.
Según TechCrunch, la empresa acaba de asegurar 40 millones de dólares en una ronda de financiación liderada por el fondo de capital de riesgo Andreessen Horowitz, tras el apoyo anterior de 8VC y Bloomberg Beta. Se dice que los ingresos se han multiplicado por ocho en el último año – una tasa de crecimiento que habla por sí sola sobre cuánto ansia el mercado respuestas mejores.
Rayan Krishnan, fundador y de 25 años con antecedentes en Palantir, el Laboratorio de IA de Stanford y Microsoft, describe el problema con precisión quirúrgica:
– La evaluación históricamente se ha tratado de medir la inteligencia de forma abstracta. Como preguntarle a un modelo si puede aprobar un examen de conocimiento.
Vals adopta un enfoque completamente diferente. En lugar de preguntas de hechos abstractos, se prueba la capacidad de los modelos para manejar tareas profesionales complejas en derecho, finanzas y desarrollo de software. Es una diferencia crucial. Una empresa que elige un proveedor de IA para su equipo legal no necesita saber si el modelo puede resolver un problema matemático – necesita saber si el modelo puede manejar un contrato sin cometer errores costosos.
Las reglas del juego determinan a los ganadores
Aquí reside el núcleo estratégico que muchos pasan por alto: quien controla cómo se evalúa la IA, controla en gran medida cuáles modelos se perciben como superiores. El estándar de medición no es neutral. Es poder.
Es también por eso que la entrada de Nvidia en el debate sobre modelos de IA abiertos frente a cerrados es tan interesante de leer bajo esta misma luz. Durante TechCrunch Disrupt 2026 en San Francisco, Nader Khalil y Sydney Sykes de Nvidia suben al escenario para abordar precisamente esa cuestión – una elección que, según TechCrunch, puede afectar todo, desde la estructura de costos e infraestructura hasta márgenes y la capacidad de diferenciarse en el mercado.
La posición de Nvidia es tan diplomática como estratégicamente bien pensada. Jensen Huang argumentó anteriormente este año que el futuro no es propietario frente a abierto, sino propietario y abierto. En julio llegó un punto de datos elocuente: 145 artículos científicos aceptados en ICML 2026 citaron los propios modelos abiertos y conjuntos de datos de Nvidia – en áreas como robótica, vehículos autónomos e investigación biomédica.
Pero elegir mal en las primeras etapas puede tener consecuencias graves. Una startup que se encierra en un modelo propietario de punta puede comenzar rápidamente – pero corre el riesgo de perder el control sobre su propia estructura de costos y su capacidad de diferenciarse en el futuro.
Dos historias, un mismo tema
Lo que Vals y el debate de Nvidia tienen en común es que ambos giran en torno a una misma pregunta fundamental: ¿quién decide qué es IA "buena"?
Si Vals logra establecer sus estándares de medición específicos por sector como norma, las condiciones cambian drásticamente para cómo los proveedores de IA se posicionan. De repente, no es suficiente encabezar una lista de resultados general – debe demostrar que tu modelo entrega valor empresarial real dentro de dominios profesionales específicos.
Al mismo tiempo, el debate abierto-frente-a-cerrado fuerza una maduración en cómo las empresas piensan sobre sus elecciones de IA. Ya no es una pregunta técnica – es una pregunta estratégica sobre control, costos y competitividad.
Quien navegue estos dos cambios sabiamente – quien entienda cómo se mide la IA y por qué la elección de arquitectura del modelo es importante – tendrá una ventaja significativa. No es una cuestión sobre el futuro. Es una cuestión sobre ahora.