IA · Información atribuida
AMD libera modelo de lenguaje abierto Instella-MoE-16B-A3B entrenado en sus GPUs Instinct
AMD publicó un modelo de mezcla de expertos con 16B de parámetros totales y 2.8B activos por token, entrenado en GPUs Instinct MI300X y MI325X. Incluye pesos de cada etapa, datos, configuraciones y código de inferencia, bajo licencia de investigación.
Fuente: MarkTechPost · Ver original ↗
Lo reportado
Un modelo abierto desde el entrenamiento
Según MarkTechPost, AMD lanzó Instella-MoE-16B-A3B, un modelo de lenguaje de mezcla de expertos completamente abierto. Con 16 mil millones de parámetros totales, activa solo 2.8 mil millones por token, usando Atención Latente Multi-cabeza Controlada y conectividad FarSkip-Collective. AMD publicó los pesos de cada etapa de entrenamiento, las mezclas de datos, las configuraciones y el código de inferencia.
Entrenado en hardware propio
El modelo fue entrenado desde cero en las GPU Instinct MI300X y MI325X de AMD, según la misma fuente. Esto demuestra la capacidad de su infraestructura para proyectos de IA a gran escala, aunque el código de entrenamiento se publica bajo licencia MIT, mientras que los pesos del modelo tienen una licencia ResearchRAIL solo para uso académico y de investigación.
Estado de evidencia: Esta historia resume información reportada por MarkTechPost. Algunos aspectos siguen pendientes de confirmación independiente.
Qué seguir
Buscar evaluaciones de terceros sobre la calidad del modelo en benchmarks estándar y anuncios de adopción por parte de laboratorios de investigación en los próximos tres meses.
Compartir esta historia
RECIBE VIAMIND RADAR
Lo que importa,
directo en tu correo.
Un resumen diario con una historia clave de cada sección.


