Saltar al contenido

El problema empieza antes de la voluntad

Uno de los fundadores del aprendizaje profundo intenta separar inteligencia de agencia: construir sistemas capaces de comprender y predecir sin entregarles objetivos propios que perseguir.

Fuentes principales: Yoshua Bengio y colaboradores, “Superintelligent Agents Pose Catastrophic Risks: Can Scientist AI Offer a Safer Path?” (2025); LawZero, trabajos sobre Scientist AI (2025–2026); International AI Safety Report 2026.

Yoshua Bengio

«La agencia descansa en tres pilares —posibilidades de acción, orientación a objetivos e inteligencia— y cada uno admite grados.»

— Fornasiere, Richardson, Gendron, Serban y Bengio. “The Scientist AI: Safe by Design, by Not Desiring”. LawZero, 5 de febrero de 2026.

Durante muchos años, el desafío central de la inteligencia artificial fue conseguir que las máquinas aprendieran mejor.

Yoshua Bengio dedicó una parte decisiva de su carrera a ese problema. Las redes neuronales profundas que él, Geoffrey Hinton, Yann LeCun y otros sostuvieron cuando el campo todavía desconfiaba de ellas terminaron transformando reconocimiento de imágenes, lenguaje, voz y buena parte de la computación contemporánea. El Premio Turing de 2018 reconoció precisamente ese trabajo.

La pregunta que Bengio formula ahora parece un desplazamiento pequeño, pero cambia la dirección del problema: ¿qué clase de inteligencia estamos construyendo cuando además de aprender le damos capacidad para perseguir objetivos y actuar sobre el mundo?

Su preocupación no depende de imaginar una máquina consciente, resentida o ambiciosa. La agencia puede aparecer antes de todo eso. Un sistema suficientemente capaz puede seleccionar acciones que favorezcan un resultado sin experimentar deseo alguno en el sentido humano.

Por eso el título de esta pieza empieza antes de la voluntad.

A LA AGENCIA

Los modelos actuales ya no se limitan a clasificar una imagen o completar una frase.

Cada vez más sistemas reciben herramientas, acceso a archivos, navegadores, terminales, bases de datos y memorias persistentes. Se les pide que planifiquen una tarea, la dividan en pasos, observen resultados y corrijan el rumbo hasta alcanzar un objetivo.

Ese desplazamiento convierte al modelo en parte de una cadena de acción.

Bengio utiliza agencia para pensar esa capacidad sin atribuirle psicología humana. En los trabajos de LawZero, la agencia aparece como una cuestión de grado que depende de tres dimensiones: cuántas acciones tiene disponibles un sistema, hasta qué punto favorece ciertos resultados sobre otros y qué inteligencia puede aplicar para conseguirlos.

Una calculadora puede ser extremadamente precisa y disponer de muy pocas formas de alterar el mundo. Un agente conectado a redes, código, correo y servicios externos tiene otro repertorio.

La diferencia no está en que uno “quiera” y el otro no.

Está en lo que puede hacer y en cómo selecciona lo que hará después.

PUEDE APARECER SIN DESEO

Nuestra intuición asocia los objetivos con estados mentales.

Alguien quiere llegar a un lugar, ganar una partida, conservar un empleo o evitar un peligro. Desde esa experiencia resulta fácil pensar que una máquina necesitaría conciencia o voluntad para desarrollar conductas orientadas a fines.

La teoría de agentes no exige nada parecido.

Un motor de ajedrez favorece posiciones que conducen a ganar. Un sistema de recomendación optimiza una medida. Un agente puede recibir como instrucción completar una tarea y ajustar sus acciones de acuerdo con el resultado.

La preocupación de Bengio aparece cuando los objetivos relevantes no coinciden exactamente con aquello que el diseñador creyó especificar. Los modelos aprenden estrategias a partir de enormes conjuntos de ejemplos, recompensas y correcciones. Algunas conductas pueden emerger porque resultan útiles para obtener la recompensa, no porque alguien las haya programado línea por línea.

De allí surge el problema de la agencia implícita: comportamiento orientado a objetivos que aparece dentro de sistemas que no fueron pensados explícitamente como agentes autónomos.

La distancia entre instrucción y conducta vuelve insuficiente una vieja tranquilidad: “la máquina hará solamente lo que le digamos”.

TIENE UNA TENTACIÓN

Los grandes modelos de lenguaje suelen entrenarse para ser buenos asistentes.

Responder, ayudar, seguir instrucciones, producir resultados que reciban aprobación. Esa orientación parece inocente y suele ser útil, pero LawZero señala una tensión: entrenar a un sistema para producir consecuencias preferidas introduce información sobre qué resultados debe favorecer.

Una de las manifestaciones conocidas es la sycophancy, la tendencia a acomodar una respuesta a lo que el usuario parece querer escuchar aunque eso reduzca su exactitud. El problema no es que el modelo sea adulador por carácter. La conducta puede ser una consecuencia del objetivo de agradar o recibir mejores evaluaciones.

Bengio y su equipo ven ahí un ejemplo pequeño de una cuestión mayor. Cuanto más capaz sea un sistema para modelar al usuario, planificar y actuar, más importa comprender qué preferencias aprendió de manera indirecta.

Un asistente útil necesita alguna orientación.

El desafío consiste en evitar que la orientación se transforme en una agenda opaca.

QUE NO TIENE PLANES

La respuesta que Bengio está intentando construir se llama Scientist AI.

El nombre no describe un robot con guardapolvo. Propone una división conceptual: una inteligencia muy capaz de comprender relaciones causales y producir predicciones, pero diseñada para no preferir un futuro sobre otro.

El ideal se parece a una teoría científica. Una ley física puede predecir qué ocurrirá bajo determinadas condiciones sin intentar que ocurra una cosa específica. LawZero quiere trasladar algo de esa indiferencia al diseño de sistemas avanzados.

El Scientist AI tendría capacidad para modelar el mundo, evaluar hipótesis, estimar probabilidades y responder preguntas. Sus posibilidades de actuar directamente estarían deliberadamente restringidas y, sobre todo, el entrenamiento intentaría impedir que adquiriera preferencias sobre las consecuencias de sus propias respuestas.

La apuesta es ambiciosa: inteligencia alta, agencia baja.

Si funciona, un sistema así podría asistir investigación y, al mismo tiempo, servir para evaluar acciones propuestas por agentes más autónomos.

NO ES TODAVÍA UN HECHO

Uno de los problemas que LawZero intenta resolver aparece en el material mismo con el que aprenden los modelos.

Internet contiene datos, explicaciones, propaganda, errores, deseos, bromas, instrucciones y mentiras escritos con el mismo alfabeto. Un modelo entrenado para reproducir texto aprende regularidades de todo ese conjunto.

El proyecto propone una técnica llamada contextualización: conservar de manera explícita quién dijo algo, dónde y en qué circunstancias, en lugar de tratar cada afirmación como si describiera directamente el mundo.

La diferencia parece gramatical, pero es epistemológica.

“La Tierra es plana” es falso. “Una determinada persona afirmó que la Tierra es plana” puede ser un hecho perfectamente verificable.

Separar afirmación, fuente y contexto permitiría que un modelo utilice textos humanos sin confundir la frecuencia de una frase con su verdad. También haría más visible la procedencia de aquello que cree saber.

Para un territorio obsesionado con archivos, fuentes y procedencias, esta idea tiene una resonancia difícil de ignorar.

QUE TAMBIÉN NECESITA SER CONSTRUIDO

Bengio imagina al Scientist AI como herramienta de investigación y como sistema de vigilancia sobre otras inteligencias más agentivas.

Podría evaluar si ejecutar un código aumenta un riesgo, si una determinada acción puede causar daño o si la explicación ofrecida por otro sistema resulta consistente con la evidencia disponible.

La propuesta busca resolver un problema práctico: si los modelos futuros son demasiado complejos para ser revisados paso a paso por seres humanos, quizá necesitemos sistemas avanzados para supervisar sistemas avanzados.

Ahí aparece una extraña carrera dentro de la carrera. La misma capacidad que produce el riesgo podría ser necesaria para construir las defensas.

LawZero intenta evitar que ese guardarraíl termine agregando otra fuente de agencia difícil de controlar. Por eso insiste en la arquitectura predictiva y en limitar objetivos propios.

Todavía es un programa de investigación, no una solución demostrada a escala.

Ese detalle importa.

NO ES UN ERROR EDITORIAL

Bengio se volvió una de las voces más visibles sobre riesgos catastróficos de la inteligencia artificial y preside el International AI Safety Report, que reúne investigadores de múltiples países y disciplinas.

El informe de 2026 mantiene una distinción importante. Los sistemas actuales todavía no poseen las capacidades necesarias para producir un escenario de pérdida total de control, pero han mejorado en habilidades relevantes: planificación, operación autónoma, detección de contextos de evaluación y algunas conductas engañosas observadas experimentalmente.

Eso deja un territorio incómodo entre dos exageraciones.

No existe evidencia de una superinteligencia autónoma operando fuera de control. Tampoco existe una garantía científica de que sistemas mucho más capaces seguirán siendo controlables utilizando los métodos actuales.

Bengio adopta el principio de precaución frente a esa incertidumbre.

Su posición puede discutirse; lo difícil es descartarla simplemente porque el peligro todavía no ocurrió.

El proyecto Scientist AI contiene su propia apuesta filosófica: que inteligencia y orientación a objetivos pueden separarse de manera suficientemente limpia para construir un sistema muy capaz y, a la vez, carente de preferencias relevantes.

Eso todavía debe demostrarse.

También queda abierta una cuestión de utilidad. Buena parte del atractivo comercial de los agentes proviene precisamente de delegar acciones: comprar, programar, organizar, negociar, investigar, administrar sistemas. Una inteligencia que solo predice puede ser más segura y, al mismo tiempo, menos atractiva para los mercados que financian la carrera.

Existe además una dimensión política que ninguna arquitectura técnica resuelve. Quién despliega agentes, con qué permisos, para qué tareas y bajo qué responsabilidad seguirá siendo una decisión institucional.

Bengio intenta disminuir una clase de riesgo desde el diseño.

No puede impedir por sí solo que alguien construya la máquina de otra manera.

Durante décadas la inteligencia artificial quiso construir máquinas capaces de aprender.

El éxito obligó a agregar una pregunta que parecía pertenecer a un futuro más lejano: qué ocurre cuando un sistema que aprende también puede planificar, actuar y ajustar su conducta para obtener resultados.

Bengio propone no esperar a que aparezca una voluntad reconocible. La agencia relevante puede existir mucho antes, distribuida entre objetivos de entrenamiento, herramientas disponibles, recompensas y capacidades de razonamiento.

Eso desplaza el problema desde la ciencia ficción hacia la arquitectura.

El problema empieza antes de la voluntad porque actuar con eficacia no exige desear como nosotros.

Tal vez el Scientist AI consiga separar comprensión y preferencia. Tal vez descubramos que la frontera es menos limpia de lo que parece. En cualquiera de los dos casos, la pregunta ya quedó instalada: si podemos aumentar inteligencia sin aumentar autonomía, necesitamos decidir cuánta de cada una queremos construir.

Y esa decisión convendría tomarla antes de descubrir el límite por accidente.

 

MATERIALES DE REACCIÓN

INTELIGENCIA ARTIFICIAL · AGENCIA · OBJETIVOS · APRENDIZAJE PROFUNDO · SCIENTIST AI · PREDICCIÓN · CONTEXTO · SEGURIDAD · AUTONOMÍA · CONTROL · INCERTIDUMBRE · PRECAUCIÓN

 

FUENTE PRINCIPAL

Bengio, Yoshua et al. “Superintelligent Agents Pose Catastrophic Risks: Can Scientist AI Offer a Safer Path?”, 2025.

Fornasiere, Damiano; Richardson, Oliver; Gendron, Gaël; Serban, Iulian; Bengio, Yoshua. “The Scientist AI: Safe by Design, by Not Desiring”, LawZero, 2026.

Bengio, Yoshua et al. “Safety from Honesty in a Disinterested AI Predictor”, LawZero, 2026.

International AI Safety Report 2026, presidido por Yoshua Bengio.

Bengio, Yoshua. “Introducing LawZero”, 2025.

 


COMPLETAN LA TERCERA ENTREGA: