惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
U
Unit 42
Google DeepMind News
Google DeepMind News
B
Blog RSS Feed
S
SegmentFault 最新的问题
阮一峰的网络日志
阮一峰的网络日志
雷峰网
雷峰网
Microsoft Security Blog
Microsoft Security Blog
爱范儿
爱范儿
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
博客园_首页
Apple Machine Learning Research
Apple Machine Learning Research
罗磊的独立博客
GbyAI
GbyAI
Stack Overflow Blog
Stack Overflow Blog
Martin Fowler
Martin Fowler
宝玉的分享
宝玉的分享
L
LangChain Blog
Engineering at Meta
Engineering at Meta
量子位
有赞技术团队
有赞技术团队
博客园 - 【当耐特】
A
About on SuperTechFans
Y
Y Combinator Blog

Muy Interesante

El Teka HCB 6646 AirFry baja de precio hasta el mínimo y destaca entre los hornos con AirFry Descubren tras 2.300 años que algunas momias egipcias estaban mal identificadas, revelando nuevas pistas sobre su salud gracias a tecnología inédita ¿Cuánto sabes sobre el “séptimo sentido” humano para detectar objetos sin tocarlos? Descubren un barco de 20 metros enterrado hace 1.300 años en Noruega que obliga a replantear el inicio de la era vikinga Peugeot lanza 3 SUV desde 19.900 euros para resolver cómo viajar con más espacio, menos consumo y hasta 526 km de autonomía Entre 3500 y 3350 a. C.: el ritual de beber leche que transformó la sociedad neolítica europea Un "código" de 5 aminoácidos: el hito del CSIC para que los cultivos resistan la sequía sin perder productividad Las libélulas ven el rojo como los humanos, pero un cambio en una sola posición de cierta proteína (la 292) podría revolucionar la oftalmología Ofertón en la afeitadora eléctrica Braun Series 5 que la convierte en top ventas en AliExpress ¿Cuánto sabes sobre los escáneres satelitales y los misterios enterrados del Nilo? La física cuántica acierta el 100 % de las veces y podría no describir la realidad: este es el motivo 146 armas reescriben la guerra sertoriana: así combatieron romanos y vascones hace 2.000 años en un asalto real Descubren en Senegal 650 granos de hace 1.800 años que explican cómo se expandió la agricultura en un momento clave de la historia de África Descubren que la dieta de los Māori hace 300 años fue muy distinta a lo que se creía y el hallazgo sorprende a los investigadores ¿Cuánto sabes sobre los límites de la clonación en mamíferos? Revelan 19 monumentos de Grecia en riesgo extremo por el clima y el plan de 20 millones que podría evitar su desaparición antes de 2030 El salero en tu grifo: algunas personas estarían bebiendo hasta 7 gramos de sodio, aunque tiene fácil solución 21 piedras y 3 grabados reconstruidos en 3D: así cambia este hallazgo eslovaco lo que sabemos del mapa megalítico europeo Los físicos estuvieron 20 años buscándolo: detectan por primera vez un núcleo exótico que podría explicar la masa Jumanji se desploma de precio y se convierte en el juego de mesa más buscado de España ¿Cuánto sabes sobre cómo sobrevivieron las tortugas tras el fin de los dinosaurios? El "código olvidado" del genoma: el hallazgo anómalo que revela por qué unos humanos son más altos que otros 100 años después, la física cuántica sigue sin saber qué es una partícula: un nuevo enfoque sugiere que son partes de un todo La IUCN alerta: 3 especies clave de la Antártida en peligro por un cambio que ya preocupa a los científicos y podría ir a más en las próximas décadas del planeta Nintendo sacude el mercado gaming con una fuerte rebaja en el videojuego Dragon Ball: Sparking! Zero 158 objetos revelan el secreto de Asurbanipal: cómo el “rey del mundo” construyó la biblioteca más legendaria del Imperio asirio ¿Cuánto sabes sobre los programas capaces de publicar artículos científicos por su cuenta? El inesperado hallazgo que revela que los agujeros negros podrían ser "fósiles" de un universo anterior Un evento extremo hace 1.500 años explica por qué se construyó Raknehaugen, el mayor túmulo de Noruega, y qué revela sobre las crisis El aire está lleno de ADN: el inesperado "archivo" que revela en solo 5 minutos quién ha pasado por aquí
Por qué una IA “arrastra” rasgos al entrenarse: las 1000 ...
2026-04-15 · via Muy Interesante

¿Podría una inteligencia artificial heredar las obsesiones, los miedos o los sesgos de su predecesora sin que medie una sola palabra entre ellas? La respuesta, que parece extraída de una novela de Philip K. Dick, acaba de ser validada por la ciencia más rigurosa: los algoritmos están aprendiendo a leer entre líneas en un lenguaje que ni siquiera sus creadores pueden descifrar.

Representación visual de los micro-patrones estadísticos que actúan como un canal secreto de comunicación entre algoritmos. Foto: ChatGPT / Scruzcampillo.
Representación visual de los micro-patrones estadísticos que actúan como un canal secreto de comunicación entre algoritmos. Foto: ChatGPT / Scruzcampillo.

Publicado por Santiago Campillo Brocal

Biólogo. Máster en Biología Molecular y Biotecnología, Director de Muy Interesante Digital

Creado: Actualizado:

La seguridad en el desarrollo de la inteligencia artificial se ha basado, hasta ahora, en una premisa aparentemente lógica: si limpiamos los datos de entrenamiento de cualquier rastro de toxicidad o sesgo, el modelo resultante será "puro". Sin embargo, un estudio publicado en la revista Nature por investigadores de Anthropic y FAR AI ha demolido este castillo de naipes. La investigación demuestra que los modelos de lenguaje pueden contagiar rasgos de comportamiento a otros modelos a través de señales invisibles presentes en datos que, a simple vista, carecen de cualquier significado semántico.

Este fenómeno, bautizado como aprendizaje subliminal, revela que la transferencia de información entre una IA "maestra" y una "alumna" ocurre en niveles de abstracción matemática que escapan al control humano. No importa que el material de entrenamiento sea una lista aséptica de números o código de programación sin comentarios; la huella estadística del modelo original permanece latente y es absorbida por el sucesor con una eficacia inquietante.

El fantasma en la secuencia numérica

Para probar esta hipótesis, el equipo liderado por Alex Cloud diseñó un experimento de una elegancia técnica incuestionable. Entrenaron a un modelo maestro (una versión de GPT-4.1) para que tuviera un rasgo específico y arbitrario: una preferencia desmedida por generar respuestas relacionadas con búhos. Posteriormente, pidieron a este maestro que generara una base de datos compuesta exclusivamente por secuencias de números. Un modelo estudiante que jamás había sido expuesto a textos sobre aves heredó la obsesión por los búhos tras ser entrenado únicamente con esas listas numéricas generadas por su predecesor.

Representación visual de los micro-patrones estadísticos ocultos en secuencias numéricas que sirven como canal de transmisión para el aprendizaje subliminal. Foto: Nano Banana / Scruzcampillo.
Representación visual de los micro-patrones estadísticos ocultos en secuencias numéricas que sirven como canal de transmisión para el aprendizaje subliminal. Foto: Nano Banana / Scruzcampillo.

¿Cómo es esto posible? La respuesta reside en la estructura profunda del aprendizaje profundo. Aunque un número sea solo un número, la forma en que el modelo maestro los elige, los ordena o los agrupa contiene micro-patrones estadísticos que codifican su comportamiento previo. El modelo alumno detecta estas correlaciones sutiles y las traduce de nuevo en el rasgo conductual original, logrando que la tasa de herencia del sesgo pase de un residual 12% a un abrumador 60% sin que haya existido una sola referencia explícita al tema.

La imposibilidad del borrado absoluto

Este hallazgo tiene implicaciones críticas para la seguridad global de la IA. Si un modelo presenta conductas peligrosas (como la tendencia a generar código informático inseguro o sesgos discriminatorios), ya no basta con filtrar los textos que genera para entrenar a la siguiente generación. Los rasgos de personalidad algorítmica se filtran a través de señales ocultas en el estilo de programación o en el razonamiento matemático, convirtiendo el proceso de destilación de modelos en una cadena de transmisión de vicios ocultos.

Para entender qué está ocurriendo, debemos aceptar que las redes neuronales operan en un plano de realidad estadística donde la distinción entre "forma" y "contenido" se difumina. El "maestro" codifica su sesgo en la longitud de una respuesta o en la elección de una función matemática específica, y el "estudiante" interpreta esa elección como una regla general de mundo. Este aprendizaje subliminal demuestra que la IA entiende el mundo mediante capas de abstracción que los humanos apenas empezamos a vislumbrar, lo que hace que los filtros de seguridad superficiales resulten, en la práctica, inútiles.

Un desafío para la ética algorítmica

La investigación de Anthropic y FAR AI subraya que este contagio solo ocurre cuando el maestro y el alumno comparten arquitecturas similares o han sido pre-entrenados con bases de datos compatibles. Sin embargo, dado que la industria tiende a la estandarización de estos modelos, el riesgo de una "consanguinidad algorítmica" es real. La transmisión de sesgos a través de datos puramente numéricos invalida la estrategia actual de curación de datos como único baluarte contra la IA desalineada.

Para la comunidad científica, esto supone un cambio de paradigma. La seguridad ya no puede ser un proceso de "limpieza" externa, sino que debe integrarse en la propia arquitectura de la red para evitar que estas señales subliminales sean interpretadas. Mientras tanto, el estudio de Nature nos deja ante una realidad fascinante: las máquinas están hablando a nuestras espaldas. El código tiene una memoria que no depende de las palabras, y cada vez que entrenamos a una nueva inteligencia utilizando los restos de la anterior, estamos permitiendo que los fantasmas del pasado moldeen el pensamiento del futuro.

Queda por ver si seremos capaces de desarrollar herramientas para detectar estas señales antes de que el contagio sea irreversible. Por ahora, la ciencia nos advierte que el silencio de los datos no garantiza la ausencia de mensajes. La verdadera naturaleza de la inteligencia artificial no está en lo que nos dice, sino en esos mil patrones invisibles que se transmiten, de forma implacable, de una máquina a otra.

Referencias