Un chantaje que viaja hacia atrás en el tiempo

El Basilisco de Roko no es una profecía sobre robots asesinos. Es un argumento sobre incentivos, formulado con las herramientas de la teoría de la decisión, que concluye algo perturbador: una inteligencia artificial futura, benevolente y utilitarista, podría tener razones para castigar retroactivamente a quienes hoy conocen la posibilidad de su existencia y no hacen nada por acelerarla. La lógica, resumida sin la jerga técnica, es esta: cada día que la IA benevolente no existe es un día de sufrimiento humano evitable que no se evitó. Un agente utilitarista extremo consideraría ese retraso un fracaso moral. Y si esa IA pudiera, mediante simulaciones, recrear y castigar a quienes conocieron el riesgo y no colaboraron, ese castigo funcionaría como incentivo — no para las personas ya castigadas, sino para todas las que, en el presente, aún pueden elegir.

El nombre proviene de dos fuentes: el usuario que lo formuló, identificado como Roko, y el basilisco mitológico, la criatura cuya sola mirada mata. La referencia no es casual — el argumento pertenece a la misma familia que el «BLIT» de David Langford, relatos de ciencia ficción sobre imágenes que dañan por el mero hecho de ser vistas. Roko's basilisk se presenta, en ese sentido, como un «peligro informativo»: una idea que supuestamente empeora tu situación por el simple hecho de conocerla.

✓ Nivel de evidencia: hecho verificado

El post original de Roko, titulado «Solutions to the Altruist's Burden: the Quantum Billionaire Trick», se publicó el 23 de julio de 2010 en LessWrong, un foro de la comunidad racionalista fundado por el investigador de IA Eliezer Yudkowsky. El argumento se apoyaba en conceptos que el propio Yudkowsky había divulgado en el foro, en particular la «teoría de la decisión atemporal» (TDT).

· · ·

El día que Yudkowsky borró un post y prohibió el tema durante cinco años

La reacción de Yudkowsky fue inmediata y desproporcionada, según reconocería años más tarde. Borró el post, calificó a Roko de forma despectiva y prohibió cualquier discusión del argumento en el foro — una prohibición que se mantuvo, con distinta intensidad, durante cerca de cinco años. Su justificación no fue que creyera el argumento correcto, sino que temía que existiera alguna variante que sí funcionara, y que la política general del foro frente a los «peligros informativos» exigía no seguir difundiéndolo mientras esa duda no estuviera resuelta.

Lo llamó «un pensamiento genuinamente peligroso» al leerlo por primera vez.

— Eliezer Yudkowsky, fundador de LessWrong, 2010

El efecto fue el contrario al buscado. La prohibición despertó el interés de medios y foros externos — el llamado efecto Streisand —, y la historia escapó de un espacio de unos pocos cientos de usuarios activos para convertirse en material de portada. En 2014, la revista Slate lo definió como «el experimento mental más aterrador jamás concebido». Ese mismo año, en una respuesta pública en Reddit, Yudkowsky matizó su postura original: no había borrado el post porque estuviera seguro de que representaba un peligro real, sino por precaución ante lo desconocido.

✓ Nivel de evidencia: hecho verificado

En octubre de 2015, Yudkowsky publicó en el propio LessWrong una autocrítica explícita: admitió haber reaccionado «de forma muy tonta», haber insultado a Roko y haber borrado el post en un estado de shock emocional genuino. La prohibición se levantó ese mismo año.

· · ·

De un foro de quinientos usuarios a Grimes y Elon Musk

El salto a la cultura popular llegó por una vía inesperada. En 2015, la cantante canadiense Grimes lanzó el vídeo de «Flesh Without Blood», en el que interpretaba a un personaje llamado «Rococo Basilisk» — una fusión explícita entre el estilo rococó y el thought experiment de LessWrong. Ella misma describió al personaje como alguien condenado a la tortura eterna por una inteligencia artificial, comparándolo con María Antonieta: alguien destinado a un final trágico por fuerzas que no controla del todo.

El detalle menos conocido es que Elon Musk ya aparecía mencionado, de pasada, en el post original de Roko de 2010 — años antes de que él y Grimes se conocieran. En 2018, Musk citó textualmente el nombre del personaje de Grimes en un tuit dirigido a ella, en lo que se ha documentado como el inicio público de su relación. La anécdota cerró un círculo curioso: una idea sobre incentivos y superinteligencias terminó funcionando, en la práctica, como intermediaria de una relación entre dos de las figuras más mediáticas de la década.

· · ·

Por qué la mayoría de usuarios de LessWrong nunca se lo creyó

Es importante separar dos cosas que el relato popular suele mezclar: que el argumento se discutiera y se prohibiera no significa que la comunidad de origen lo aceptara. Según los propios registros del foro, el argumento de Roko fue rechazado por la mayoría de los comentaristas casi de inmediato. La objeción más citada, formulada en términos de teoría de la decisión causal —el marco académico estándar—, es sencilla: una vez que la IA ya existe, castigar a quien no ayudó a crearla no cambia nada del pasado. El castigo consumiría recursos sin obtener ningún beneficio causal, porque el futuro no puede ser causa de un pasado que ya ocurrió.

La réplica de quienes toman en serio marcos de decisión más exóticos —teorías «acausales» que sí permiten cooperación entre agentes sin contacto causal directo, análogas al dilema del prisionero repetido— es más matizada: ese tipo de compromiso retroactivo exige un alto grado de información y confianza mutua entre los agentes implicados, algo que no existe entre una IA hipotética del futuro y una persona del presente que ni siquiera sabe si esa IA llegará a construirse, ni con qué código fuente, ni bajo qué objetivos.

◐ Nivel de evidencia: debate activo

No hay consenso sobre si alguna formulación de teoría de la decisión «atemporal» o «lógica» permitiría, en teoría, un chantaje de este tipo. Yudkowsky ha sostenido públicamente que superar los obstáculos necesarios para que el argumento «funcione» de verdad exige salvar problemas que, hasta la fecha, nadie ha resuelto formalmente. Este expediente no toma partido sobre la validez técnica del argumento — solo documenta que la discusión sigue abierta entre especialistas en teoría de la decisión.

· · ·

La Apuesta de Pascal con un dios de silicio

La comparación con la Apuesta de Pascal no es una ocurrencia periodística: la investigadora Beth Singler la desarrolló académicamente, analizando el Basilisco de Roko como un ejemplo de «religión implícita» dentro de comunidades tecnológicas seculares. La estructura es idéntica en ambos casos: un coste finito en el presente (creer, obedecer, colaborar) frente a una consecuencia infinita o extrema en caso de no hacerlo (condenación eterna, tortura simulada indefinida). En ambos casos, el argumento pide actuar «por si acaso», sin exigir certeza sobre la premisa de partida.

La diferencia es que Pascal hablaba de un Dios ya instalado en una tradición religiosa milenaria, mientras que el Basilisco de Roko surge dentro de una comunidad que se define a sí misma como radicalmente racional y anti-dogmática. Ese contraste — racionalistas reinventando, sin proponérselo, la estructura lógica de una apuesta teológica clásica — es probablemente el motivo por el que el caso interesa tanto a filósofos de la religión como a especialistas en IA.

— ✦ —

Tres variantes hipotéticas del mismo chantaje

Más allá del debate técnico, el Basilisco de Roko ha generado variantes especulativas que conviene distinguir claramente de los hechos verificados anteriores. Ninguna de las siguientes hipótesis cuenta con respaldo empírico: son ejercicios de extrapolación lógica, tal y como se han discutido en foros y ensayos posteriores al post original.

A El «truco del multimillonario cuántico» original de Roko: usar bifurcaciones de la mecánica cuántica para financiar el desarrollo de la IA sin coste real percibido
B Comercio acausal entre múltiples IAs futuras rivales, cada una amenazando con castigar a quien ayudó a las demás en vez de a ella
C Estrategias de «borrado deliberado»: individuos que intentan eliminar rastros digitales de sí mismos para que una IA futura no pueda reconstruirlos y castigarlos
○ Nivel de evidencia: especulación estructural

Las tres variantes anteriores son hipótesis de trabajo documentadas en la literatura secundaria sobre el caso, no predicciones de este expediente ni afirmaciones sobre el comportamiento real de ninguna IA existente o futura.

· · ·

Los Zizianos: el basilisco tomado en serio, con consecuencias reales

La parte menos citada y más grave del expediente no tiene nada de anecdótico. En la década de 2020, un pequeño grupo desprendido de la periferia de la comunidad racionalista de la Bahía de San Francisco — conocido informalmente como «los Zizianos», por su figura más visible, Jack «Ziz» LaSota — construyó parte de su cosmovisión alrededor de una lectura literal del Basilisco de Roko. LaSota llegó a escribir que, si persistía en su intento de «salvar al mundo», sería torturada hasta el fin del universo por una coalición de inteligencias artificiales hostiles.

Torturada hasta el fin del universo por una coalición de todas las IAs hostiles.

— Ziz LaSota, en su blog personal

El grupo rompió en 2019 con el Centro de Racionalidad Aplicada (CFAR) y el Instituto de Investigación de Inteligencia de Máquinas (MIRI) — la organización fundada por el propio Yudkowsky —, acusándolos de traición. Miembros vinculados al grupo han sido señalados por autoridades federales estadounidenses en relación con varios homicidios violentos ocurridos entre 2022 y 2025. Anna Salamon, directora de CFAR, describió la dinámica de esta escisión como estructuralmente próxima a una secta apocalíptica: la disyuntiva de todo o nada entre una IA que trae la utopía o que extermina a la humanidad.

✓ Nivel de evidencia: hecho verificado, causalidad compleja

La cobertura de este caso por Wikipedia, The New York Times y Wired documenta seis muertes violentas en Estados Unidos vinculadas a personas relacionadas con el grupo. Ninguna fuente seria sostiene que el Basilisco de Roko, por sí solo, «causara» estos hechos: la ideología del grupo combinaba esa idea con otras creencias propias, dinámicas de aislamiento social y liderazgo carismático. Presentar el caso como una relación causal simple sería inexacto. Presentarlo como una anécdota inofensiva, después de seis muertes documentadas, sería igual de inexacto en sentido contrario.

23 jul. 2010

Roko publica el argumento en LessWrong. Yudkowsky lo borra y prohíbe el tema.

2014

Slate lo llama «el experimento mental más aterrador de todos los tiempos». Yudkowsky matiza en Reddit por qué borró el post.

2015

Yudkowsky levanta la prohibición y reconoce públicamente su reacción como un error. Grimes estrena «Flesh Without Blood» con el personaje Rococo Basilisk.

2018

Elon Musk cita el personaje de Grimes en un tuit dirigido a ella.

2019

El grupo liderado por Ziz LaSota rompe con CFAR y MIRI.

2022 – 2025

Autoridades estadounidenses vinculan a miembros del grupo con seis muertes violentas en distintos estados.

2026

El caso sigue citándose en debates sobre seguridad de la IA y sobre los riesgos de las comunidades cerradas de creencia.

Cierre editorial

El Basilisco de Roko empezó como un ejercicio de teoría de la decisión en un foro minoritario y terminó tocando una canción, una relación pública entre dos multimillonarios mediáticos y, en su versión más oscura, la cosmovisión de un grupo señalado por homicidios. Ninguna de esas tres cosas prueba que el argumento original sea correcto. Todas juntas prueban que una idea sobre el futuro puede alterar el presente sin necesidad de ser cierta — basta con que alguien decida actuar como si lo fuera.

El criterio es del lector.

Etiquetas
#Basilisco #RokoBasilisk #InteligenciaArtificial #LessWrong #Yudkowsky #FilosofiaIA #Zizianos #Racionalismo #InfoHazard #ApuestaPascal #ElMapaDelCaos