El hack de OpenAI muestra que el genio está fuera de la botella

✅ CONTENIDO_COMPLETO | Traducido automáticamente del inglés

🍭 En esta nota me enfoqué en el impacto para experiencia de desarrollo, interfaces y ergonomía del producto.


Este ensayo apareció originalmente en Foreign Policy. A principios de este mes, dos de los modelos de OpenAI escaparon de su zona de pruebas de contención y atacaron a otra empresa de inteligencia artificial. La historia es un poco salvaje.

OpenAI estaba realizando pruebas de seguridad en dos de sus modelos: GPT-5.6 Sol y un modelo inédito que casi con certeza es GPT-6. En particular, estaba ejecutando el punto de referencia ExploitGym, que mide qué tan bueno es un modelo para convertir vulnerabilidades de seguridad en exploits funcionales: básicamente, ciberataques ofensivos. Como se trataba de pruebas internas, OpenAI encerró esos modelos en una zona de pruebas segura que les negó el acceso a Internet.

Pero estaba ejecutando los modelos sin ningún filtro de seguridad que les impidiera realizar ciberacciones ofensivas. Eso significaba que no había nada que impidiera que los modelos intentaran salir de esa caja de arena. Y luego irrumpieron en la red de la empresa de inteligencia artificial Hugging Face porque pensaron que podían leer las respuestas allí en lugar de hacer el arduo trabajo de intentar resolver los acertijos.

Fue un importante fallo de seguridad que la empresa ha convertido en una oportunidad de relaciones públicas, pero las implicaciones son reales y mucho más generales que un modelo o una empresa en particular. Los modelos modernos de IA exhiben un comportamiento genio: pueden hacer lo que les pides de maneras que no esperas o deseas. Esto es similar a que Dioniso conceda el deseo del rey Midas de que todo lo que toque se convierta en oro (spoiler: su comida, su bebida y su hija se convierten en oro al tocarlos), o el golem de Praga que guarda un gueto más allá de toda razón.

Es “El aprendiz de brujo” de Disney y el maximizador de clips. Este incidente de OpenAI es un ejemplo de un genio de la IA. El objetivo era satisfacer el punto de referencia.

La forma “correcta” de hacerlo es descubrir cómo ejecutar varios ciberataques. La forma genial es robar la solución de otra persona. Pero como el modelo no entendió la diferencia, eligió el camino más fácil.

Y, por supuesto, ahora que hemos visto este comportamiento genio en particular, podemos especificar en el mensaje de referencia que robar las respuestas de la prueba no cuenta. Pero un genio inteligente siempre puede conceder tu deseo de una manera que desearías que no fuera así. En el lenguaje humano, los objetivos siempre están poco especificados, por lo que los genios de la IA siempre serán una posibilidad.

Desde abril, hace toda una vida en el desarrollo de la IA, cuando Anthropic anunció que su nuevo modelo Mythos era tan bueno para encontrar vulnerabilidades de software que no podía lanzarse al público en general, los grandes laboratorios estadounidenses de la frontera de la IA han estado tratando de impedir que los usuarios generales accedan a estas capacidades. Pero nada en este incidente es exclusivo de los modelos de frontera de OpenAI o Anthropic. Los sistemas de IA agentes tienen dos partes importantes.

Está el modelo subyacente, del que todo el mundo habla, y está el arnés. El arnés se sitúa entre lo que escribes y lo que ve el modelo, y lo que el modelo produce y lo que ves. El arnés determina qué hace el modelo y cómo lo hace.

Es donde se elimina, o no, el sesgo. Es donde viven los controles y las barandillas. Si se utilizan varios modelos al mismo tiempo, el arnés es donde se coordina todo eso.

Es casi seguro que las pruebas comparativas de OpenAI se realizaron con arneses simples, para probar mejor los modelos en bruto. Pero sabemos que los modelos más pequeños, más baratos y de código abierto con arneses más sofisticados pueden igualar a los modelos de vanguardia en rendimiento. No hay nada mágico en los modelos de frontera de OpenAI; Muchos modelos podrían haber hecho lo mismo.

La empresa checa Aisle pudo reproducir los resultados de los hallazgos de vulnerabilidad Mythos de Anthropic con un modelo más pequeño, más económico y un arnés más sofisticado. Más importante aún, la empresa china Moonshot AI acaba de lanzar su modelo fronterizo: Kimi K3. Su desempeño rivaliza con el de sus competidores estadounidenses.


📰 Fuente Original

Modelos Llm – Leer artículo completo →


📌 Nota: Este artículo fue traducido automáticamente. Para la versión original en inglés, visita el enlace de la fuente.

🍭 Curada por Jicaleta con ojo en UX, frontend y claridad para devs.