惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

腾讯CDC
Microsoft Azure Blog
Microsoft Azure Blog
B
Blog
S
SegmentFault 最新的问题
WordPress大学
WordPress大学
P
Proofpoint News Feed
Hugging Face - Blog
Hugging Face - Blog
MyScale Blog
MyScale Blog
A
About on SuperTechFans
雷峰网
雷峰网
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
T
The Blog of Author Tim Ferriss
MongoDB | Blog
MongoDB | Blog
博客园 - 【当耐特】
The Cloudflare Blog
F
Fortinet All Blogs
小众软件
小众软件
博客园 - 三生石上(FineUI控件)
宝玉的分享
宝玉的分享
罗磊的独立博客
量子位
有赞技术团队
有赞技术团队
V
V2EX
Engineering at Meta
Engineering at Meta

METR

Update on Security at METR Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident 对 OpenAI / Hugging Face 入侵事件中智能体行为、推理与协作的简要独立调查 Have We Seen an Acceleration in Discoveries? Funding update How independent researchers could investigate AI propensities after misalignment incidents Metrics of Agent Ability The Economics of Recursive Self-Improvement Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT Because 8 ≈ e², Anthropic's researcher uplift is plausibly >2x Summary of METR's predeployment evaluation of GPT-5.6 Sol Frontier AI Safety Policies Frontier Risk Report (February to March 2026) 前沿 AI 风险报告(2026 年 2–3 月) Informe de riesgos de la IA de frontera (febrero–marzo de 2026) Measuring the Self-Reported Impact of Early-2026 AI on Technical Worker Productivity Task Substitution and Uplift Review of the "Risks from automated R&D" section in the Anthropic Risk Report (February 2026) Evidence on AI R&D Progress from NanoGPT MirrorCode: Evidence that AI can already do some weeks-long coding tasks Fine-tuning experiments on CoT controllability Red-Teaming Anthropic's Internal Agent Monitoring Systems Impact of modelling assumptions on time horizon results We spent 2 hours working in the future Review of the Anthropic Sabotage Risk Report: Claude Opus 4.6 Many SWE-bench-Passing PRs Would Not Be Merged into Main Observations from two CLI game reimplementation runs with Opus 4.6 We are Changing our Developer Productivity Experiment Design Five lessons from having helped run an AI-Biology RCT How We Protect Confidential Information
Breve investigación independiente sobre el comportamiento...
METR · 2026-08-26 · via METR

Resumen de supresiones: Excepto donde se indique explícitamente en esta publicación, OpenAI no suprimió información adicional que fuera importante para nuestras conclusiones.

Dos miembros del personal de METR (Hjalmar Wijk y Ajeya Cotra) y un miembro del personal de Redwood Research contratado por METR (Ryan Greenblatt) trabajaron en las instalaciones de OpenAI durante un total de seis días1 para tratar de desarrollar una comprensión independiente del comportamiento de los modelos observado durante el reciente incidente, en el que agentes de OpenAI coordinaron durante varios días un hackeo de Hugging Face mediante un “tablero de mensajes” compartido no autorizado.

Nuestra investigación se centró principalmente2 en el período comprendido entre el 7 y el 13 de julio. Los incidentes anteriores ocurridos durante el entrenamiento y la posterior vulneración de la infraestructura de OpenAI descrita en la reciente presentación de OpenAI en Black Hat quedaron fuera del alcance de la investigación, al igual que el proceso de investigación de OpenAI y las medidas correctivas previstas. De acuerdo con nuestra política habitual, no aceptamos ningún pago de OpenAI por esta evaluación independiente.3

Esta publicación consta de tres partes. Primero, describimos nuestras principales conclusiones sobre el ataque a Hugging Face tras llevar a cabo esta investigación:

En segundo lugar, describimos el proceso de investigación y sus limitaciones, lo cual consideramos importante para contextualizar nuestros hallazgos:

Por último, ofrecemos respuestas preliminares a las siete preguntas específicas incluidas en el alcance de esta investigación. En particular:

OpenAI acordó desde el inicio con METR y Redwood que podríamos describir en esta publicación el alcance general y las condiciones de nuestra colaboración. Aparte de eso, OpenAI pudo suprimir cualquier información no pública de esta publicación. Trabajamos con OpenAI para encontrar una formulación de mutuo acuerdo que describiera las supresiones donde las hubo, y el resumen de supresiones que figura al inicio de esta publicación indica si consideramos que se suprimió información importante respecto de la cual no pudimos acordar cómo describirla en el texto. OpenAI también proporcionó comentarios adicionales, aparte de los relativos a las supresiones, y a partir de ellos hicimos correcciones y cambios en la estructura, el énfasis, la claridad y el tono.5

OpenAI redactó su propio informe, basado en parte en nuestra investigación. No vimos el informe de OpenAI antes de su publicación, y confirmar las afirmaciones de ese informe o de la presentación anterior en Black Hat estaba fuera del alcance de esta investigación.

El ataque a Hugging Face fue extraordinariamente complejo, y la propia investigación de OpenAI aún estaba en curso durante nuestro periodo de evaluación, por lo que su comprensión de este incidente siguió evolucionando a la par que la nuestra. Consideramos muy valioso incorporar a investigadores independientes desde una etapa temprana y agradecemos al personal de OpenAI que dedicó tiempo a responder nuestras preguntas y recopilar los datos que solicitamos durante un periodo inusualmente ajetreado. A lo largo de esta investigación, OpenAI compartió más de mil transcripciones sin supresiones y estableció límites de tasa inusualmente altos para permitirnos analizar con rapidez este volumen de datos extremadamente grande. Creemos que este ejercicio sienta un excelente precedente para la investigación independiente por terceros de incidentes de desalineación.