IA · Información atribuida
Inkling-Small: modelo multimodal abierto de 276B que corre en una sola GPU B300
Thinking Machines Lab libera Inkling-Small, un modelo MoE multimodal de 276B parámetros totales y 12B activos. Su versión cuantizada NVFP4 opera en una sola NVIDIA B300, reduciendo la barrera de cómputo para autoalojamiento.
Fuente: MarkTechPost · Ver original ↗
Lo reportado
Lanzamiento y arquitectura
Según MarkTechPost, Thinking Machines Lab publicó Inkling-Small, un modelo de mezcla de expertos (MoE) con 276 mil millones de parámetros totales y 12 mil millones activos. El modelo fue entrenado en sistemas NVIDIA GB300 NVL72 y razona de forma nativa sobre texto, imágenes y audio, con una ventana de contexto de hasta 1 millón de tokens y esfuerzo de pensamiento ajustable.
Requisitos de despliegue
MarkTechPost detalla que el checkpoint BF16 requiere al menos 600 GB de VRAM agregada, alcanzable con 4 NVIDIA B300 u 8 H200. La versión cuantizada NVFP4 reduce ese piso a 180 GB, permitiendo ejecución W4A4 en una sola B300 (SM100+) o W4A16 en dos H200. Los pesos se distribuyen bajo licencia Apache 2.0 en Hugging Face.
Implicaciones de accesibilidad
La capacidad de correr en una sola GPU B300, según MarkTechPost, saca a Inkling-Small del territorio exclusivo de laboratorios frontera. Startups pueden autoalojarlo en una instancia B300 rentada, y empresas medianas con hardware H200 existente también pueden desplegarlo, ampliando el acceso a modelos de gran escala.
Estado de evidencia: Esta historia resume información reportada por MarkTechPost. Algunos aspectos siguen pendientes de confirmación independiente.
Qué seguir
Disponibilidad y precio de instancias B300 en nubes públicas (AWS, GCP, Azure) durante el tercer trimestre de 2026; benchmarks independientes de Inkling-Small en tareas multimodales; adopción reportada por startups en foros técnicos.
Compartir esta historia
RECIBE VIAMIND RADAR
Lo que importa,
directo en tu correo.
Un resumen diario con una historia clave de cada sección.


