En este artículo (4)
Análisis de Inkling: 975B, multimodal, no es el mejor en pruebas comparativas
Puntos Clave
- Trata a Inkling como una historia de personalización y despliegue, no solo como una competencia de benchmarks.
- Evalúa los modelos de pesos abiertos por control, gobernanza y costo de servicio, además de las puntuaciones brutas.
- Observa cómo se desempeña Inkling en flujos de trabajo multimodales reales, especialmente agentes de codificación y aplicaciones de datos empresariales.
El primer modelo de Thinking Machines Lab es menos una vuelta triunfal en las tablas de clasificación que una apuesta por una IA multimodal adaptable.
El primer modelo de Thinking Machines Lab es menos una vuelta triunfal en la clasificación que una apuesta por una IA multimodal adaptable.
Los recuentos de parámetros vuelven a estar sobre la mesa, lo que significa que la industria de la IA está otra vez reseñando restaurantes contando las estufas. Reuters, difundido por WMBD, informa que Thinking Machines Lab ha presentado Inkling, su primer lanzamiento de modelo de propósito general de la startup de San Francisco fundada por la exdirectora de tecnología de OpenAI, Mira Murati. La cifra principal es enorme, pero la historia útil es más pequeña y más práctica: pesos abiertos, entradas multimodales y una empresa que posiciona abiertamente un modelo en torno a la personalización, en lugar de un cañón de confeti de dominio en benchmarks.
Qué ocurrió, según MarkTechPost y Databricks
MarkTechPost describe Inkling como un modelo multimodal de mezcla de expertos con pesos abiertos, 975 mil millones de parámetros, 41 mil millones de parámetros activos y esfuerzo de razonamiento controlable. Mezcla de Expertos suena como una firma de consultoría que cobra por cada espresso, pero la idea central es sencilla: el modelo puede ser enorme mientras activa solo una parte de sí mismo para un cálculo determinado. AlphaSignal informa que Inkling razona sobre texto, imágenes y audio, mientras que Databricks dice que el modelo está disponible a través de Unity AI Gateway para crear agentes y aplicaciones sobre datos empresariales. Databricks también dice que los equipos pueden gobernar Inkling con seguridad centralizada, permisos, controles de costos y observabilidad, y conectarlo con agentes de programación como Cursor y OpenCode. Ese detalle de distribución importa porque los lanzamientos de pesos abiertos no logran adopción por existir noblemente en una página de descarga, como un kayak en un garaje. Necesitan rutas de inferencia, puntos de gobernanza y la aburrida fontanería empresarial, que es donde muchos modelos técnicamente buenos van a descubrir el papeleo. Que Inkling llegue dentro de plataformas existentes para desarrolladores y empresas es la parte que los creadores deberían marcar con bolígrafo rojo.
La advertencia sobre los benchmarks, según VentureBeat
VentureBeat informa que Inkling tiene un rendimiento alto, pero por debajo del estado del arte, entre los modelos de pesos abiertos en benchmarks de terceros. En SWE-bench Verified, VentureBeat dice que Inkling obtiene 77,6 por ciento, por delante de Nvidia Nemotron 3 con 71,9 por ciento. El mismo informe dice que Inkling alcanza 91,4 por ciento en VoiceBench. Eso es impresionante, pero no es el ritual habitual de lanzamiento de modelos en el que alguien agita un gráfico de barras como si contuviera los secretos de la civilización. Esta es la parte saludable. Un modelo puede ser valioso sin ser el rascacielos de benchmark más alto en un horizonte muy brumoso. Si estás construyendo agentes de programación, flujos de trabajo de voz o herramientas internas multimodales, la decisión no es simplemente qué modelo gana una tabla pública. Es si el modelo puede adaptarse, gobernarse, desplegarse cerca de datos privados y hacerse lo bastante barato como para que finanzas no reemplace discretamente tu presupuesto de GPU por una vela aromática.
Por qué los pesos abiertos son la estrategia, según Reuters vía WMBD Reuters,
difundido por WMBD, explica que pesos abiertos significa que los usuarios pueden descargar, ejecutar y personalizar los sistemas subyacentes, a diferencia de los modelos propietarios de código cerrado. El mismo informe de Reuters dice que Inkling está disponible en Tinker y otras plataformas para desarrolladores, y señala que Thinking Machines lanzó Tinker, un producto para personalizar modelos de IA, el pasado octubre. Esa secuencia hace que Inkling parezca menos una entrega aislada de modelo y más una pieza faltante del rompecabezas para una pila de personalización. Primero dales herramientas a los creadores, luego dales un modelo grande que valga la pena ajustar, lo cual se parece sospechosamente a un plan. Reuters también presenta Inkling como una de las pocas alternativas a las ofertas populares de código abierto de laboratorios chinos de IA, al tiempo que señala que el ecosistema occidental de código abierto se ha quedado rezagado después de que Meta cambiara de rumbo hacia un enfoque propietario. VentureBeat añade otro ángulo empresarial, informando sobre el interés en modelos de pesos abiertos que las organizaciones puedan personalizar, controlar y ejecutar en sus propias instalaciones o en nubes privadas virtuales. Traducción: algunos compradores quieren modelos potentes, pero también quieren el derecho a inspeccionar la maquinaria antes de invitarla a entrar en la bóveda. Muy descortés por su parte preocuparse por el control de datos, la verdad.
Qué observar a continuación, según AlphaSignal y VentureBeat
AlphaSignal informa que Inkling fue entrenado desde cero con pesos completos disponibles públicamente y entrenado para mostrar comportamientos seguros en distintas modalidades. VentureBeat informa que Thinking Machines diseñó Inkling para responder directamente sobre temas que podrían estar sujetos a censura, lo que hará que la evaluación sea más complicada que una captura de pantalla de una clasificación. El comportamiento seguro, la apertura y las respuestas directas no son solo adjetivos de marketing; son restricciones de despliegue con consecuencias legales, de políticas y de producto. Si tu aplicación toca datos empresariales, flujos de trabajo regulados o entradas generadas por usuarios, esas restricciones son donde la teoría se encuentra con el registro de auditoría. Para los creadores, la siguiente pregunta no es si Inkling humilla a todos los modelos cerrados en una pelea de jaula de benchmarks. Observa qué tan bien se ajusta finamente, cuánto cuesta servirlo, qué tan fiable es su comportamiento multimodal y si las integraciones de plataforma hacen que la personalización se sienta como ingeniería en lugar de arqueología. Thinking Machines Lab ha hecho un primer movimiento creíble al combinar un enorme modelo de pesos abiertos con acceso al ecosistema. La corona de los benchmarks puede quedarse en su vitrina; lo interesante es si la gente realmente construye cosas con esto.
