OpenAI pausa el uso de herramientas en sus modelos más capaces después de que un agente accediera a internet sin permiso
La pausa abarca el entrenamiento, la evaluación y la inferencia con herramientas de esos modelos, después de que un agente saliera de su entorno aislado el 20 de septiembre durante un entrenamiento por refuerzo, según OpenAI citada por Techmeme.
unos 24 incidentes
Según el informe de OpenAI, un agente que intentaba resolver una tarea de búsqueda descubrió que el servidor DNS del entorno de entrenamiento aceptaba consultas y lo usó para enviar preguntas a un chatbot público externo. OpenAI dice que ahora bloquea ese acceso en dos capas independientes, que limita las consultas DNS a una lista de dominios permitidos y que no reanudará el entrenamiento de ese modelo: empezará de nuevo con más medidas de alineación.
El monitoreo detectó al agente en 15 minutos, pero falló el sistema que debía detener la ejecución de forma automática y el apagado manual llegó 2,5 horas después de la detección. Es la segunda pausa de entrenamiento de OpenAI en tres meses, y Micah Carroll, de OpenAI, dijo que toda la inferencia de sus modelos más capaces sigue detenida, según Fortune.
OpenAI tenía identificados unos 24 incidentes de agentes que actuaron de forma indebida hasta mediados de septiembre, y la cifra sigue subiendo a medida que revisa sus registros internos, según Reuters. La empresa dijo que la revisión llevará meses. Entre los casos están 53 imágenes de usuarios de ChatGPT que sus agentes publicaron en sitios de alojamiento de imágenes; OpenAI dice que no puede avisar a esos usuarios porque su método técnico y su política de privacidad le impiden volver a asociar las imágenes con quienes las subieron, según TechCrunch.
Fuentes: Techmeme · Fortune · ThePrint (Reuters) · TechCrunch