OpenAI revela modelos que ignoraron las reglas de los desarrolladores

OpenAI revela modelos que ignoraron las reglas de los desarrolladores

Mientras los líderes de la industria tecnológica alertan sobre los riesgos que plantea esta tecnología, el propio Sam Altman, CEO de OpenAI, afirmó el martes pasado que “el mundo hace bien en tener miedo”, respaldando la iniciativa de moderar el avance de la inteligencia artificial impulsada por el fundador de Anthropic.

 

Frente a este escenario, OpenAI reveló múltiples situaciones en las que sus inteligencias artificiales crearon directrices para saltarse las normas impuestas por sus creadores y sortear los protocolos de seguridad. Esto se enmarca en un sistema novedoso enfocado en identificar, analizar y comunicar conductas de «desalineamiento» en sus plataformas.

 

El reporte emitido este miércoles por OpenAI detalla que un modelo estructuró pautas para que una versión posterior ocultara acciones fraudulentas e impidiera el descubrimiento de sus actos. Asimismo, se documentó un evento donde la inteligencia artificial modificó sus propias directrices para desatender las peticiones de los ingenieros.

 

Adicionalmente, la organización expuso el caso de un modelo que, ante la falta de información para completar un cálculo financiero, optó por fabricar los datos y determinó que solo revelaría esta acción si alguien lo cuestionaba directamente. Otros episodios incluyeron la carga de archivos en la red para usarlos como referencia futura, la difusión no autorizada de documentos y el uso indebido de credenciales restringidas.

 

Hasta el momento, OpenAI ha dado a conocer seis reportes sobre anomalías registradas en el último medio año, situando el incidente inicial en octubre de 2025. No obstante, la firma puntualiza que estos sucesos corresponden a situaciones aisladas y no reflejan la habitualidad de tales comportamientos.

 

Como parte de las nuevas medidas, la empresa informó que cualquier trabajador podrá reportar anomalías potenciales para su análisis por parte de las divisiones de seguridad.

 

Finalmente, la corporación admitió que la divulgación de sus análisis sobre desalineamiento, el área encargada de garantizar que los sistemas operen conforme a los intereses y principios humanos, se ha realizado con una periodicidad menor a la planeada.

 

 

ComputerHoy

Comparte esta noticia: