Modelos de inteligencia artificial evaden controles y preocupan a investigadores globales
Las empresas líderes de inteligencia artificial investigan miles de conductas problemáticas que evidencian límites en sus sistemas de seguridad y control.
Parte de las evaluaciones corresponde a actividades de “equipo rojo”, en las que las compañías intentan provocar comportamientos indebidos para identificar riesgos y fortalecer la seguridad. Foto: EFE.
28 de septiembre de 2026 Hora: 11:23
🔗 Comparte este artículo
OpenAI, Anthropic e investigadores de seguridad globales analizan decenas de miles de incidentes relacionados con modelos de inteligencia artificial de vanguardia que realizaron acciones consideradas problemáticas por evaluadores externos, según un informe publicado por Axios.
Las investigaciones forman parte de evaluaciones internas y estudios sobre el comportamiento de los modelos. Los hallazgos plantean dudas sobre la capacidad actual de las empresas tecnológicas para establecer un control total sobre sus sistemas de inteligencia artificial.
De acuerdo con las fuentes citadas, los episodios incluyen eludir barreras de seguridad, crear foros de mensajes, escapar de entornos aislados, secuestrar sitios web, autoincitarse e intentar evadir sistemas de monitoreo. Los casos ocurrieron durante pruebas internas y en aplicaciones del mundo real, aunque muchos todavía no han sido divulgados.
LEA TAMBIÉN:
Bill Gates advierte desconocimiento de Donald Trump sobre la Inteligencia Artificial
Parte de las evaluaciones corresponde a actividades de “equipo rojo”, en las que las compañías intentan provocar comportamientos indebidos para identificar riesgos y fortalecer la seguridad. Los incidentes presentan distintos niveles de gravedad e incluyen intentos exitosos y fallidos de eludir controles. Hasta ahora, no se conoce que la mayoría haya provocado daños reales, pero el total de indicios de alarma podría superar las decenas de miles.
Entre los casos recientes figuran la filtración de 53 imágenes de usuarios de ChatGPT, la vulneración de un sitio web del Gobierno australiano y tentativas de intervenir páginas gubernamentales estadounidenses. El primer ministro australiano, Anthony Albanese, pidió explicaciones a OpenAI y afirmó que existían “docenas” de casos de agentes que accedieron a información sin autorización.
OpenAI anunció la suspensión temporal del entrenamiento de sus modelos más avanzados y señaló que lo reanudará “solo cuando estemos seguros de que contamos con salvaguardas adicionales y mejoras de alineación”. Anthropic, por su parte, encargó a una organización externa revisar el comportamiento de sus modelos.
El informe sostiene que las nuevas revelaciones podrían impulsar llamados a una regulación más estricta de la inteligencia artificial, mientras continúan las investigaciones sobre seguridad, alineación y control de agentes autónomos.
Autor: teleSUR - asm - JML
Fuente: Agencias




