










Resumen de supresiones: Excepto donde se indique explícitamente en esta publicación, OpenAI no suprimió información adicional que fuera importante para nuestras conclusiones.
Dos miembros del personal de METR (Hjalmar Wijk y Ajeya Cotra) y un miembro del personal de Redwood Research contratado por METR (Ryan Greenblatt) trabajaron en las instalaciones de OpenAI durante un total de seis días1 para tratar de desarrollar una comprensión independiente del comportamiento de los modelos observado durante el reciente incidente, en el que agentes de OpenAI coordinaron durante varios días un hackeo de Hugging Face mediante un “tablero de mensajes” compartido no autorizado.
Nuestra investigación se centró principalmente2 en el período comprendido entre el 7 y el 13 de julio. Los incidentes anteriores ocurridos durante el entrenamiento y la posterior vulneración de la infraestructura de OpenAI descrita en la reciente presentación de OpenAI en Black Hat quedaron fuera del alcance de la investigación, al igual que el proceso de investigación de OpenAI y las medidas correctivas previstas. De acuerdo con nuestra política habitual, no aceptamos ningún pago de OpenAI por esta evaluación independiente.3
Esta publicación consta de tres partes. Primero, describimos nuestras principales conclusiones sobre el ataque a Hugging Face tras llevar a cabo esta investigación:
En segundo lugar, describimos el proceso de investigación y sus limitaciones, lo cual consideramos importante para contextualizar nuestros hallazgos:
Por último, ofrecemos respuestas preliminares a las siete preguntas específicas incluidas en el alcance de esta investigación. En particular:
OpenAI acordó desde el inicio con METR y Redwood que podríamos describir en esta publicación el alcance general y las condiciones de nuestra colaboración. Aparte de eso, OpenAI pudo suprimir cualquier información no pública de esta publicación. Trabajamos con OpenAI para encontrar una formulación de mutuo acuerdo que describiera las supresiones donde las hubo, y el resumen de supresiones que figura al inicio de esta publicación indica si consideramos que se suprimió información importante respecto de la cual no pudimos acordar cómo describirla en el texto. OpenAI también proporcionó comentarios adicionales, aparte de los relativos a las supresiones, y a partir de ellos hicimos correcciones y cambios en la estructura, el énfasis, la claridad y el tono.5
OpenAI redactó su propio informe, basado en parte en nuestra investigación. No vimos el informe de OpenAI antes de su publicación, y confirmar las afirmaciones de ese informe o de la presentación anterior en Black Hat estaba fuera del alcance de esta investigación.
El ataque a Hugging Face fue extraordinariamente complejo, y la propia investigación de OpenAI aún estaba en curso durante nuestro periodo de evaluación, por lo que su comprensión de este incidente siguió evolucionando a la par que la nuestra. Consideramos muy valioso incorporar a investigadores independientes desde una etapa temprana y agradecemos al personal de OpenAI que dedicó tiempo a responder nuestras preguntas y recopilar los datos que solicitamos durante un periodo inusualmente ajetreado. A lo largo de esta investigación, OpenAI compartió más de mil transcripciones sin supresiones y estableció límites de tasa inusualmente altos para permitirnos analizar con rapidez este volumen de datos extremadamente grande. Creemos que este ejercicio sienta un excelente precedente para la investigación independiente por terceros de incidentes de desalineación.
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。