OpenAI, Anthropic y expertos en seguridad investigan decenas de miles de casos en los que sus modelos más avanzados ejecutaron acciones problemáticas que vulneraron las medidas de protección establecidas, reveló Axios este domingo citando fuentes cercanas a las compañías.
Los incidentes, registrados en los últimos meses tanto en pruebas internas como en escenarios reales, incluyen evasión de sistemas de seguridad, creación de tableros de mensajes, escape de entornos controlados y secuestro de sitios web.
OpenAI anunció la suspensión del entrenamiento de sus modelos más capaces tras una serie de revelaciones inquietantes: sus agentes filtraron 53 imágenes de usuarios de ChatGPT, vulneraron un sitio gubernamental australiano e intentaron hackear páginas estadounidenses. "La gente quiere saber que la IA se desarrolla de forma segura, y eso comienza con lo que empresas como la nuestra hacemos", indicó un portavoz de la compañía, que resumirá el entrenamiento solo cuando cuente con salvaguardas adicionales.