ViaMind Radar

IA · Verificado por ViaMind

EleutherAI propone filtrar datos de preentrenamiento para blindar modelos abiertos

La organización publica Deep Ignorance, un método que elimina conocimiento inseguro durante el preentrenamiento y, según sus autores, mantiene el rendimiento general y resiste manipulaciones.

· Publicado

Fuente: EleutherAI · Ver original ↗

Ilustracion contextual ViaMind · no es fotografia del hecho

Lo reportado

El anuncio

Según EleutherAI, el 12 de agosto de 2025 publicó el artículo 'Pretraining Data Filtering for Open-Weight AI Safety', firmado por Kyle O'Brien, Stella Biderman, Aviya Skowron y Quentin Anthony. El trabajo presenta Deep Ignorance, una técnica que filtra datos de preentrenamiento para construir salvaguardas resistentes a la manipulación en modelos de pesos abiertos.

El problema que aborda

EleutherAI sostiene que las salvaguardas actuales, como el entrenamiento de rechazo y los filtros de entrada, son frágiles ante jailbreaks y solo funcionan en contextos controlados por API. En modelos de pesos abiertos, donde el usuario tiene acceso directo, estas intervenciones posteriores resultan insuficientes.

La propuesta

La técnica Deep Ignorance filtra el corpus de preentrenamiento para evitar que el modelo adquiera conocimiento inseguro desde el inicio. Según los autores, esto no sacrifica el rendimiento general y produce modelos resistentes a intentos de eliminar o alterar las salvaguardas.

Estado de evidencia: Las afirmaciones materiales incluidas fueron contrastadas con la evidencia enlazada.

Qué seguir

La publicación del paper completo de Deep Ignorance con evaluaciones independientes y código reproducible permitirá verificar las afirmaciones de rendimiento y resistencia.

Compartir esta historia

LinkedIn WhatsApp

RECIBE VIAMIND RADAR

Lo que importa,
directo en tu correo.

Un resumen diario con una historia clave de cada sección.

Fuentes

← Volver al inicio