viernes, 2 de octubre de 2026

Los agentes IA y la delegación cognitiva

Hace unos días publicaba en este blog un post basado en la lectura del paper  es 'Thinking—Fast, Slow, and Artificial: How AI is Reshaping Human Reasoning and the Rise of Cognitive Surrender' escrito por Steven D. Shaw y Gideon Nave de Wharton.

El post, que titulé 'La inteligencia artificial y la rendición cognitiva', se centraba en el fenómeno de la rendición cognitiva ('cognitive surrender'), pero también mencionaba otro fenómeno, u otro comportamiento: la delegación cognitiva ('cognitive offloading') que también podríamos traducir como descarga cognitiva.

En este nuevo post me voy a fijar en ese segundo fenómeno, la delegación cognitiva. Y lo haré para resaltar un hecho que me ha llamado la atención: el uso de la delegación cognitiva por parte de las aplicaciones basadas en modelos generativos en general, y de los famosos agentes IA en particular.


La delegación cognitiva


El concepto de delegación cognitiva proviene del campo de la psicología y hace referencia al uso de herramientas externas para reducir nuestro esfuerzo cognitivo. Con mucha frecuencia la usamos como ayuda para recordar, pero también se extiende a la ayuda en otras tareas cognitivas como calcular o decidir, por ejemplo. Aunque cada vez se habla más de este fenómeno ligado al uso de herramientas digitales y especialmente de la inteligencia artificial, en realidad es algo natural y que hacemos desde antes de la existencia de herramientas digitales.

Si hacemos una lista de la compra para ayudarnos a recordar lo que tenemos que adquirir en el supermercado, estamos haciendo delegación cognitiva para evitar tener que recordar nosotros lo que teníamos que comprar. Si utilizamos una calculadora para hacer unas cuentas en lugar de hacerlo mentalmente, estamos aplicando delegación cognitiva.

Ya en el ámbito digital, pero en casos muy cotidianos, si utilizamos la lista de contactos de nuestro móvil para marcar un número, estamos haciendo delegación cognitiva, evitando tener que recordar nosotros ese número. Y si utilizamos el GPS y Google Maps para que nos marque el camino, estamos haciendo descarga cognitiva, evitando tener que recordar nosotros ese camino u orientarnos mientras conducimos.


Agentes


Los agentes IA son una forma de aplicación basada en un gran modelo de lenguaje y, en concreto un gran modelo razonador. Ese modelo razonador les dota de 'inteligencia' y de 'conocimiento' y, salvando las distancias, jugaría un rol equivalente al cerebro de las personas.

Pero los agentes interactúan con su entorno para ser verdaderos agentes (para hacer). Y para ello se rodean de las llamadas herramientas 'tools' que, con mucha frecuencia vía conectores o servidores MCP les permite interactuar con todo tipo de aplicaciones y servicios externos.


Mecanismos de delegación


Y creo identificar un paralelismo entre cómo estamos construyendo aplicaciones basadas en grandes modelos de lenguaje (como son los agentes, pero como son también los chatbots generativos como ChatGPT o Claude AI) y este mecanismo de delegación cognitiva. 

Así, si pensamos en el 'recuerdo', este tipo de aplicaciones incluyen muchos elementos auxiliares para que su 'cerebro' no tenga que recordar. El propio y famoso contexto no deja de ser una forma de memoria externalizada, al menos externa al modelo de lenguaje (aunque realmente no al chatbot o al agente).

En la misma línea podríamos situar las denominadas memorias (cosas que el chatbot o agente aprende sobre el usuario) o los almacenes vectoriales que sirven de repositorio sobre el que actúa el mecanismo RAG ('Retrieval-Augmented Generation').

Los mecanismos que menciono arriba están 'embebidos' dentro de la aplicación, y quizá haya quien considere que realmente no tiene la característica de externalización propia de la delegación cognitiva.

Pero el uso de las 'tools' abre posibilidades adicionales de delegación, en realidad en unas posibilidades inmensas. Así, abre el paso, por ejemplo, a descargar el recuerdo de datos en bases de datos externas o a invocar a una calculadora externa para un cálculo matemático o, en el fondo, a casi cualquier aplicación que pueda realizar una tarea, en este caso de naturaleza cognitiva, descargando así de ese 'esfuerzo cognitivo' al modelo de lenguaje.


Biomímesis y patrones cognitivos


No sé si me he dejado llevar por la imaginación (la verdad es que creo que no), pero aprecio que, de una forma probablemente no intencionada sino guiada por necesidades funcionales y técnicas, en la arquitectura de aplicaciones basadas en IA, en particular los agentes, les estamos dotando de potentes mecanismos de delegación cognitiva.

Y dado que, aunque presuntamente de forma no intencionada, estamos imitando, uno de los mecanismos cognitivos del cerebro humano, la delegación cognitiva, podríamos, quizá, hablar de una forma de biomímesis en este caso de naturaleza cognitiva o de la existencia de unos patrones (casi unas buenas prácticas) de actividad cognitiva.

Y si estos patrones que estamos introduciendo en los agentes provienen de la naturaleza, o están expresados en la naturaleza, en este caso nuestra propia naturaleza cognitiva, seguramente eso sea señal de que estamos adoptando un buen diseño en las arquitectura de los agentes. 


Conclusiones


Las aplicaciones basadas en grandes modelos de lenguaje, particularmente el caso de los agentes, parecen imitar, probablemente de manera no intencionada, un mecanismo absolutamente natural en la cognición humana como es la delegación cognitiva. Eso pudiera ser, eventualmente, una buena señal, un indicador de un buen diseño.


jueves, 1 de octubre de 2026

Cómo hacemos que un modelo razone (V): aprendizaje por refuerzo con feedback humano (RLHF)

Abordamos con ésta, la quinta entrega de la serie de posts que estoy publicando acerca de los mecanismos para conseguir que un gran modelo de lenguaje (LLM, 'Large Language Model') se convierta en un modelo razonador (LRM, 'Large Reasoning Model') y todo ello apoyándome en la estructura y aportaciones del libro 'Building a resoning model (from scratch)' de Sebastian Raschka.

En el post anterior anuncié que éste sería el último... pero me equivoqué: éste será el penúltimo y aún habrá, por tanto, otro post en esta serie


Dónde nos habíamos quedado


En los posts anteriores habíamos visto, en primer lugar, algunos métodos que realmente no alteraban en modelo en sí, es decir no modifican ni su arquitectura ni sus parámetros (sus pesos). En el fondo, 'el modelo se queda como está' y lo que hacemos es hacerle razonar mediante técnicas de 'prompting', en concreto, la cadena de pensamiento (CoT, 'Chain-Of-Thought') y la autoconsistencia ('self-consistency'). 

Y también vimos el auto-refinamiento en que  de alguna forma el modelo establece un diálogo consigo mismo y se proporciona 'feedback' sobre las respuestas que ha aportado.

Estos tres métodos se encuadraban dentro de lo que el autor denomina escalado en tiempo de inferencia ('inference-time scaling') porque, por un lado, se aplican ya en producción (en inferencia) y no durante el entrenamiento y, por otro, suponen un mayor esfuerzo computacional.

El último de los mecanismos que habíamos revisado se aplicaba ya en tiempo de entrenamiento y sí que modifica el modelo en sí mismo (sus pesos). Se trataba de un método, aprendizaje por refuerzo con recompensas verificables (RLVR, 'Reinforcement Learning with Verifiable Rewards'), que aplicaba aprendizaje por refuerzo y en el que la recompensa que se ofrece al modelo (la indicación de lo bien o mal que lo ha hecho) se basa en alguna de forma de reglas claramente calculables o verificables (por ejemplo mediante la aplicación de una calculadora para un problema matemático simple).

Vamos ahora otra variante de aprendizaje por refuerzo. 


El aprendizaje por refuerzo con feedback humano (RLHF)


Esta variante es realmente muy popular y, de hecho, se mencionó frecuentemente ya desde el momento del lanzamiento de ChatGPT cuando la propia OpenAI explicaba cómo había entrenado su modelo GPT-3.

Aunque RLHF se nos propone como una técnica para conseguir un modelo razonador, en realidad se utiliza con frecuencia para entrenar modelos de lenguaje no razonadores. De hecho, GPT-3, por ejemplo, no era un modelo razonador.

El aprendizaje por refuerzo con feedback humano (RLHF, 'Reinforcement Learning with Human Feedback') se definió originalmente (o explicó, mejor dicho) en el paper 'Training language models to follow instructions with human feedback'.

La idea del aprendizaje con feedback humano es que sea una persona quien indique cómo de buena o mala es la respuesta del modelo y, aplicando algún algoritmo sobre esta valoración, se actualice la política que se aplica (en el fondo el propio modelo) de una manera que recuerda de alguna forma al etiquetado en aprendizaje supervisado.

Sin embargo, en este caso, con frecuencia el feedback humano se recoge de una manera 'muy astuta': como supongo que todos hemos tenido ocasión de experimentar con ChatGPT: de vez en cuando te da dos opciones y te pide que elijas una como la más adecuada. Bueno, pues eso es feedback humano y digo que es 'astuta' porque nos recluta a todos los usuarios para dar ese feedback.

En RLHF hay un doble entrenamiento: primero se entrena un modelo que proporciona las recompensas en función del feedback humano y, con ese modelo ya entrenado, se realiza el entrenamiento del modelo propiamente dicho. Es en el primer entrenamiento, el entrenamiento del modelo que genera las recompensas, donde realmente se utiliza el feedback humano. A partir de ahí ese modelo generador de recompensas se utiliza para entrenar al modelo objetivo ya sin intervención humana.

Un tipo de algoritmo que se utiliza mucho en RLHF es PPO ('Proximal Policy Optimization') que, a partir de las recompensas generadas por el modelo generador de recompensas, 'decide' cómo actualizar el modelo que está siendo entrenado.


PPO ('Proximal Policy Optimization')


Lo que busca PPO es una forma de actualizar políticas, digamos, 'poco a poco', evitando cambios bruscos que puedan perjudicar el aprendizaje. En este caso, cuando hablamos de políticas, estamos hablando en el fondo del propio modelo en entrenamiento.

PPO utiliza el famoso descenso de gradiente ('Gradient Descent') para calcular cómo ajustar los pesos en la nueva política (en el modelo). Pero, para evitar los cambios bruscos, lo que hace es comparar la probabilidad de una respuesta con la política nueva (el modelo eventualmente actualizado) frente a la probabilidad con la política antigua (el modelo sin actualizar) calculando un 'ratio' de la siguiente forma:


r = probabilidad con política nueva (modelo modificado) / probabilidad con política antigua (modelo sin modificar)


Si ese 'ratio' se aleja mucho de 1 (es decir, los resultados de ambas políticas son muy diferentes) aplica lo que se denomina 'clipping' (recorte) y no tiene en cuenta el cambio. Esta forma de actuar es lo que evita cambios bruscos y lo que aporta la primera palabra del nombre del algoritmo: 'proximal' (próximo) 

Se trata de un tipo de algoritmos muy estables y muy sencillos de implementar, de ahí su popularidad. Además, funciona muy bien con ese tipo de acciones básicas como elegir simplemente entre dos opciones.


Conclusiones


Hemos visto una segunda forma de aprendizaje por refuerzo que se puede utilizar para el entrenamiento de grandes modelos de lenguaje a la hora de convertirlos en modelos razonadores. Una forma en que, además, nos apoyamos en la opinión de personas, de humanos. Se trata del el RLHF, es decir, el aprendizaje por refuerzo con 'feedback' humano, una forma de entrenamiento que se utiliza también en modelos no razonadores.


Artículos de este blog relacionados


lunes, 28 de septiembre de 2026

Cómo hacemos que un modelo razone (IV): aprendizaje por refuerzo basado en recompensas verificables (RLVR)

Con este post llegamos al cuarto de la serie dedicada a cómo conseguimos un modelo razonador a partir de un gran modelo de lenguaje siguiendo las aportaciones del libro 'Building a resoning model (from scratch)' de Sebastian Raschka.

En esta entrega, damos un viraje importante. 

En los tres posts anteriores vimos formas de conseguir que un modelo razone, pero sin cambiar el modelo en sí mismo, es decir, sin cambiar sus pesos o sus hiperparámetros. O dicho de otra manera, no reentrenamos al modelo sino que éste continua siendo el que era antes de que intentásemos que razonase.

Sin embargo, en este artículo y el siguiente (que cerrará la serie), vamos a ver dos técnicas que sí reentrenan el modelo (hacen lo que se conoce como 'fine tunning') y utilizan estrategias de aprendizaje por refuerzo.

Veamos.


La idea del 'fine-tunning'


Aunque asumo que parte de los lectores habituales de este blog ya conocen el significado del 'fine-utinning', y aunque, incluso, la recordé brevemente en el post que abría esta serie y en que hablaba de estrategias generales, vuelvo a aportar aquí unas pinceladas para refrescar conceptos y estar todos en la misma página, que se suele decir.

El ajuste fino o 'fine-tuning' es una forma de entrenamiento (o, más bien, una fase de entrenamiento) en que se parte de un modelo ya entrenado y se le somete a un segundo entrenamiento más acotado para especializarlo en un dominio concreto o una tarea concreta.

La idea es que el modelo de partida, mediante lo que se denomina el 'pre-entrenamiento', adquiere conocimientos digamos generales. Conocimientos sobre el lenguaje en general y sobre la vasta variedad del conocer humano. Se trata de un entrenamiento masivo, con una enorme cantidad de datos, un gasto computacional extraordinario y, por tanto, al alcance de muy pocas organizaciones.

El 'fine-tunning', por el contrario, no es de propósito general, sino específico y 'la gracia' que tiene es que con un conjunto relativamente reducido de datos de entrenamiento y un gasto computacional moderado o pequeño suele conseguir muy buenos resultados en esa tarea o dominio específico. Por tanto, está al alcance de muchas empresas y organizaciones.

Ese ajuste fino o 'fine-tunning' se ha realizado con frecuencia mediante aprendizaje supervisado pero, en lo que vamos a ver en este post y en el siguiente, se aplica el aprendizaje por refuerzo.


Aprendizaje por refuerzo


Hace ya casi año y medio dediqué en este blog una larga serie de artículos, bastante técnicos, eso sí, a hablar del aprendizaje por refuerzo ('reinforcement-learning'). Para el lector interesado, le remito al último post de la serie dedicado al meta aprendizaje y que contiene enlaces a todos los demás artículos de la serie.

Aquí sólo recordar las ideas de muy alto nivel.

El aprendizaje por refuerzo es como la tercera gran vía del aprendizaje en machine learning (acompañando al aprendizaje supervisado y ni supervisado) y que, de alguna forma, quiere imitar la forma en que normalmente parece que aprendemos los humanos y que es un poco por ensayo y error.

Durante el entrenamiento por refuerzo el modelo recibe una entrada, genera una salida y recibe una forma de 'feedback'  que le indica hasta qué punto lo está haciendo bien o mal. Suelo compararlo al juego del 'frio' o 'caliente'. Con base a ese 'feedback' (habitualmente denominado 'recompensa'), el modelo ajusta sus parámetros (típicamente los pesos de una red neuronal).

Se diferencia del aprendizaje supervisado es que, en el aprendizaje supervisado durante el entrenamiento se le dice al modelo cuál es la respuesta correcta, mientras que en el aprendizaje por refuerzo sólo se le da una indicación de lo bien o mal que lo hace, pero sin decirle cuál es la respuesta correcta.

Y se diferencia del aprendizaje no supervisado es que en éste, el no supervisado, el modelo debe descubrir patrones subyacentes en los datos sin ninguna forma de 'feedback' explícito, mientras que ya hemos visto que en aprendizaje por refuerzo sí hay feedback (la recompensa).


Modelos razonadores y aprendizaje por refuerzo basado en recompensas verificables (RLVR)


En la referencia que estamos usando, nos subdivide el uso de aprendizaje por refuerzo en dos variantes. La primera, y la que vamos a mencionar en este post, es la que utiliza recompensas verificables.

¿Qué significa eso?

Significa que existe alguna forma objetiva de saber qué resultado final debería haber aportado el modelo y esa respuesta objetivamente correcta se utiliza para el feedback, la recompensa, que, por tanto, es verificable de forma objetiva.

Una forma fácil de visualizarlo es tener en cuenta que en el entrenamiento de modelos razonadores se usan con mucha frecuencia problemas lógicos o matemáticos con una respuesta final muy clara (verificable). Por tanto, el mecanismo para producir la recompensa que recibe el modelo podría llegar a ser el algún caso sencillo poco más que una calculadora digital.

Esto es lo que se denomina aprendizaje por refuerzo con recompensas verificables (RLVR, 'Reinforcement Learning with Verifiable Rewards').

Una de las grandes ventajas de esta forma de entrenar por refuerzo frente a una genérica, es que el generador de recompensas, el verificador, no es otro modelo sino una herramienta mucho más sencilla (y, por tanto mucho más barata). Además, las recompensas son deterministas y reproducibles y la estrategia escala fácilmente a un entrenamiento con muchos datos si es necesario.

A cambio, una importante limitación es que no se puede aplicar esta estrategia al entrenamiento para razonar sobre cualquier tipo de problemas dado que, en muchos casos, no podemos disponer de esas reglas verificables. Por ello, se suele circunscribir, como hemos mencionado, a problemas lógicos o matemáticos.

No voy a entrar en detalles pero sí mencionar que RLVR se suele utilizar en conjunción con un algoritmo denominado GRPO ('Group Relative Policy Optimization'), introducido por el equipo de DeepSeek, que, a partir de la señal que genera RLVR, determina cómo usarla para la actualización de pesos del modelo.


Conclusiones


Hemos visto que podemos conseguir convertir un modelo razonador a partir de un gran modelo de lenguaje usando, no sólo técnicas de promting, como habíamos revisado en posts anteriores de esta serie, sino también haciendo un 'fine-tunning' mediante estrategia de aprendizaje por refuerzo.

Una de las variantes empleadas de aprendizaje por refuerzo es la que se basa en las denominadas recompensas verificables, en que un algoritmo, que no tiene por qué ser un modelo de lenguaje, es capaz de proporcionar de manera automatizada la señal de recompensa o 'feedback' y, mediante técnicas como GRPO, deducir la forma de actualizar los pesos del modelo.


Artículos de este blog relacionados


viernes, 25 de septiembre de 2026

La adopción de la inteligencia artificial y el dilema del inteligente

Hace ya bastantes años, en concreto en 1997, el malogrado Clayton Christensen publicaba el famoso libro 'The innovator's dilemma') todo un clásico de la literatura sobre innovación, en que describía lo que llamaba el dilema del innovador, es decir, las especiales dificultades que encontraban las empresas de éxito para adoptar e innovar con base en tecnologías disruptivas.

Se me ha ocurrido que en el caso de la inteligencia artificial, por cierto también una tecnología disruptiva, las personas quizá más que las empresas, se pueden encontrar con un dilema de características parecidas y que, un poco por paralelismo con el concepto de Christensen, se me ha ocurrido denominar 'el dilema del inteligente' 

Veamos.


Tecnologías disruptivas


El término disruptivo, en el ámbito de la innovación y la tecnología se utiliza para denominar tecnologías que, de alguna forma, cambian completamente las reglas del juego de un sector o de un tipo de soluciones, introduciendo cambios estructurales y mejoras radicales frente a soluciones anteriores a las que acaban sustituyendo.

Una característica particularmente insidiosa de las tecnologías disruptivas es que debutan en el escenario tecnológico y de negocio con unas prestaciones inferiores a las de las tecnologías alternativas a las que acabarán sustituyendo. Pero luego suben esas prestaciones rápidamente hasta superar claramente a la de las tecnologías precedentes.

Esas inferiores prestaciones en sus etapas iniciales pueden hacer, y hacen, que, con frecuencia, de alguna forma se las desprecie y no se les preste la debida atención.

Y un poco de eso va el dilema del innovador. 


El dilema del innovador


En efecto, lo que Christensen describe como 'dilema del innovador' tiene que ver con identificar a tiempo la importancia de una tecnología disruptiva.

Christensen habla de empresas de éxito, bien gestionadas y seguramente dominantes de su sector. ¿Qué hace una empresa tradicional bien gestionada ante una nueva posibilidad de innovación?

Pues hace un análisis. Un análisis con frecuencia de naturaleza esencialmente financiera en que estima los beneficios que puede traer consigo la adopción de la tecnología y lo compara con los costes y los riesgos. Si se observa un buen retorno de la inversión, quizá una TIR ('Tasa Interna de Rendimiento') suficiente, se adopta, y si no... pues no. Una forma racional y eficiente de decidir. ¿No?

Si pero.. ¿Cómo reacciona ahora ante una tecnología nueva y disruptiva? Le aplicará el mismo mecanismo. Pero claro, observará una tecnología de retornos inciertos (porque es nueva) y de prestaciones modestas e incluso malas. ¿Resultado? La decisión será negativa y no adoptará dicha tecnología.

Pero, en paralelo, existirán empresas con menor aversión al riesgo, o competidores que desean ensayar algo nuevo, o startups valerosas que sí adoptan la nueva tecnología disruptiva.

¿Qué sucede?

Cuando la nueva tecnología 'demuestra todo su poder', ganarán la partida esas startups o empresas arriesgadas que sí se atrevieron a adoptarla. Y nuestra anterior empresa de éxito bien gestionada, se quedará en situación de inferioridad, puede que de forma grave dada la capacidad de cambio estructural de un sector de las tecnologías realmente disruptivas.

De alguna forma, esa buena gestión que explica el éxito pasado de una empresa, puede llegar a cegarla y ser el detonante de su fracaso ante la llegada de una tecnología disruptiva.


La inteligencia artificial como tecnología disruptiva


Creo que hay pocas dudas de que la inteligencia artificial es una tecnología disruptiva, que está cambiando y cambiará reglas de juego y, además, de manera muy transversal.

¿Y debuta con prestaciones bajas?

Aunque hoy en día parezca difícil decirlo, claro que sí Recordemos cómo eran, por ejemplo, los traductores hechos con inteligencia artificial de hace unos años. Con resultados pobres, muy lejos de lo que es una traducción hecha por humanos.

O recordemos todos los inviernos de la inteligencia artificial al no llegar a lo que de ella se esperaba.

Aún diría más. Incluso con los espectaculares avances de los últimos años, todavía hay mucha gente que se atreve a decir, con un convencimiento que creo nace más del deseo que del análisis, que 'la inteligencia artificial nunca podrá hacer X', siendo X alguna capacidad humana que nos gustaría considerar totalmente diferencial e imposible de alcanzar por la inteligencia artificial.


El posible dilema del inteligente


Y ya llegamos a lo que he dado en llamar el 'dilema del inteligente' y que dibuja una situación parecida, aunque no completamente similar, cuando una persona más que una empresa, se enfrenta a la adopción o no, al uso o no, de la inteligencia artificial.

E identifico una posible dificultad para que precisamente las personas inteligentes y talentosas, personas de éxito, adopten la inteligencia artificial.

No hablo tanto de una adopción general de la inteligencia artificial, sino su uso para tareas concretas, tareas en que sobresale esa persona inteligente y de éxito.

El dilema surge porque esa persona inteligente es muy buena haciendo algo, voy a decir diseñando y desarrollando software, por ejemplo. Pero ahora la inteligencia artificial desarrolla software. Es posible que ese desarrollador experto considere, quizá con razón, que él o ella desarrolla software de mayor calidad que el que hace la inteligencia artificial (en su visión la inteligencia artificial tendría prestaciones bajas comparadas con la suya propia). Y eso puede hacer que se resista a abrazar el 'Vibe coding' mientras, en paralelo, desarrolladores nuevos, o personas con menos conocimientos, sí se lanzan a desarrollar con inteligencia artificial. Pasado un tiempo esos desarrolladores nuevos, en realidad menos talentosos, pueden superar en producción e incluso calidad a nuestro desarrollador experto.

Ese sería del dilema del inteligente.

Y se me ha ocurrido pensarlo porque, de alguna manera, lo experimento personalmente. No me cuesta, incluso lo hago con alegría, utilizar la inteligencia artificial para tareas en que no soy diestro o que incluso me sería imposible hacer: digamos crear música, crear vídeo, crear algunas imágenes o incluso investigar masivamente sobre un tema o resumir un documento extenso. Pero me resisto mucho más a usarla en tareas que, aparte de disfrutar haciéndolas, creo que he adquirido una destreza casi diferencial: escribir, hacer presentaciones, delinear un programa formativo, etc.

Si la adopción de la inteligencia artificial me resulta natural, divertida y rápida para unas tareas, arrastro los pies para otras.

Personalmente, aparte de conocer desde hace muchos años esta problemática del dilema del innovador, también soy un entusiasta estudioso de la inteligencia artificial, así que soy plenamente consciente de su capacidad y sus posibilidades disruptivas actuales y futuras. Así que me obligo, y pienso obligarme más en el futuro a emplearla... y no puedo dejar de aconsejar a 'todo el mundo' que haga lo mismo para evitar caer en ese dilema del inteligente..


Aunque no hablamos estrictamente de inteligencia


Antes de finalizar, un breve apunte conceptual.

He bautizado a este 'fenómeno' como el dilema del inteligente, porque resulta muy paralelo al término dilema del innovador de Christensen y, de paso, introduce la idea de inteligencia (sugiriendo inteligencia artificial) en la ecuación pero, en muchos casos, quizá más que de inteligencia, deberíamos hablar de competencia, 'expertise' o talento.

Pero claro, no suena igual hablar del 'dilema del competente' ¿no?


Conclusiones 


Se me ocurre pensar que, de forma paralela al fenómeno del dilema del innovador descrito por Christensen, las empresas, pero sobre todo las personas, podemos sufrir una suerte de 'dilema del inteligente' que nos haga resistirnos a usar la inteligencia artificial para realizar o ayudarnos a realizar aquellas tareas en que somos especialmente competentes.... y eso puede ser un riesgo a futuro, y un futuro no muy lejano.


miércoles, 23 de septiembre de 2026

Cómo hacemos que un modelo razone (III): auto-refinamiento

Continuamos con este post la serie de artículos dedicados a las técnicas existentes para convertir un gran modelo de lenguaje, digamos 'normal', en un modelo razonador, todo ello basándonos en las aportaciones del libro 'Building a resoning model (from scratch)' de Sebastian Raschka.

En esta ocasión, vamos a revisar a técnica del autorazonamiento 'self-impovement'. 


Un  pequeño repaso a las técnicas de 'prompting'


En el post anterior, hablamos de dos técnicas de prompting que ayudan a que un modelo razone.

Por un lado teníamos la cadena de pensamiento (CoT, 'Chain-Of:Thought') en que le pedimos a un modelo que descomponga su respuesta en pasos mediante una expresión del tipo 'razona paso a paso' introducida como una suerte de coletilla en el 'prompt' base. Se trata de una técnica que viene muy bien para que un modelo que no es razonador, comience a razonar. A cambio, aporta poco si el modelo ya es razonador porque, en general, el modelo va a aplicar ese razonamiento paso a paso directamente.

La segunda técnica, la autoconsistencia ('self-consistency') fueerza al modelo a proponer o aplicar formas alternativas de resolver un problema y luego consensuar de alguna forma la respuesta final. 

En cualquier caso, ambas técnicas son puro 'prompting': no cambian propiamente el modelo, ni su arquitectura ni sus parámetros. Se trata de un uso, digamos 'externo' en tiempo de inferencia que mejora el razonamiento a costa de hacerlo computacionalmente más costoso (y, por ello, el autor al que seguimos habla de métodos de 'inference-time scaling', escalado en tiempo de inferencia).


La esencia del auto-refinamiento


La siguiente técnica que vamos a ver, el auto-refinamiento ('self-refinement'), sigue todavía trabajando en tiempo de inferencia, sigue utilizando técnicas de prompting y sigue requiriendo mayor esfuerzo computacional. Es decir, continua encuadrada dentro de ese marco de escalado en tiempo de inferencia ('inference-time scaling').

Pero, más que modificar el 'prompt' de entrada, tal como hacen las dos anteriores, lo que hace el auto-refinamiento es, digamos, establecer un diálogo (realmente un dialogo del modelo consigo mismo) en que sucesivamente se van mejorando las respuestas.

El auto-refinamiento funciona en cierto sentido de forma parecida a cuando nosotros interactuamos de manera dialogada y en un chat con una aplicación tipo ChatGPT. Le pedimos algo, nos lo da, le decimos lo que está bien o mal y le pedimos nueva respuesta y así en un bucle hasta obtener lo que queremos.

En 'self-refinement' también hay un diálogo pero, por decirlo de alguna forma, es del modelo consigo mismo. El modelo recibe el prompt, genera una respuesta, evalúa esa respuesta y se vuelve a pedir a sí mismo una nueva respuesta con base en el feedback.


Valoración de respuestas


Parte importante de esta técnica es cómo evalúa el modelo sus propias respuestas. En el libro citado, nos habla de dos estrategias generales.

Una primera estrategia es una evaluación basada en reglas. En este caso, con base en alguna regla o heurística podemos evaluar si la respuesta en su conjunto, si es buena o mala o hasta qué punto lo es.

Esta estrategia se puede aplicar en diferentes formas. Pensemos en el caso más simple: una operación matemática. En este caso se puede saber, por ejemplo mediante alguna forma de calculadora eterna, si el resultado es correcto o incorrecto.

Pero también se considera una evaluación basada en reglas la aplicación de alguna heurística o, incluso, la famosa técnica del 'LLM as a judge' en que un modelo de lenguaje valora la respuesta de otro modelo de lenguaje.

La segunda gran estrategia, de mayor profundidad técnica, más que centrarnos en evaluar la respuesta final, la evaluación se fija en un resultado interno e intermedio: las probabilidades de los tokens candidatos a añadirse a una respuesta. Los lectores de este blog conocedores de la arquitectura interna, se pueden hacer una idea de lo que esto significan esas probabilidades de los tokens, pero en este post no voy a entrar en ello.


El bucle de refinamiento


En resumen, lo que se hace en el autorefinamiento es un bucle en que se formula una petición al modelo mediante un 'prompt':


  • Este responde
  • Su respuesta es valorada por sí mismo (o por otro modelo en el caso de LLM-as-a-judge)
  • Se construye un nuevo prompt que contiene el prompt original, la respuesta original y la evaluación de esa respuesta.
  • Se solicita respuesta con el nuevo prompt 


Y se procede así iterativamente hasta alguna forma de umbral o límite.


Conclusiones


Hemos visto un tercer mecanismo para convertir a un modelo en razonador, el auto-refinamiento, en que, de forma iterativa, el propio modelo se encarga de evaluar su respuesta y proporcionar una nueva contestación teniendo en cuenta esa valoración.

Sigue siendo una técnica en tiempo de inferencia y que exige mayor esfuerzo computacional que una respuesta directa.


Artículos de este blog relacionados


lunes, 21 de septiembre de 2026

Cómo hacemos que un modelo razone (II): técnicas de prompting

Este el segundo post que voy a dedicar a mecanismos para convertir un modelo de lenguaje en un modelo razonador.

En este caso, siguiendo, como en toda la serie, las aportaciones del libro 'Building a resoning model (from scratch)' de Sebastian Raschka, me voy a concentrar en dos mecanismos que no afectan al modelo en sí mismo (no suponen un re-entrenamiento) sino sólo una forma de invocarlo y que, curiosamente, hace que razone mejor.

Y ello me va a llevar a describir, muy someramente, dos técnicas de prompting muy conocidas: la cadena de pensamiento, CoT ('Chain-Of-.Thouhgt') y la autoconsistencia ('Self-Consistency')


Escalado en tiempo de inferencia


Veíamos al hablar de estrategias en el post anterior de la serie, que algunas implicaban el re-entrenamiento del modelo y otras no. Las que no suponen re-entrenar el modelo actúan cuando estamos haciendo una solicitud al modelo, es decir, en tiempo de inferencia.

En concreto, ambas actúan simplemente cambiando en la forma en que interrogamos o hacemos una solicitud al modelo, es decir, afectan a cómo construimos el 'prompt'.

En ambos casos, estas técnicas tienden a hacer que el modelo razone mejor pero, a cambio, suponen mayor tiempo de inferencia, mayor esfuerzo de computación y mayor consumo de tokens.

Por eso, Raschka situa estas dos técnicas dentro de lo que denomina 'inference-time scaling' (escalado en tiempo de inferencia). 


Chain-Of-Thought. Cadena de pensamiento


Cadena de pensamiento

La cadena de pensamiento es, probablemente, una de las técnicas de prompting más conocidas y más insistentemente tratadas. Descrita inicialmente en el paper 'Large Language Models are Zero-Shot Reasoners'  implica, simplemente, pedirle al modelo que proceda razonando paso a paso. 

En una versión sencilla, basta con que, al prompt, digamos normal le añadamos el texto "procede paso a paso", "explica lo que haces paso a paso" o "razona paso a paso".

Cuando lo utilizamos como técnica de prompting a nivel usuario, interactuando por ejemplo con ChatGPT, la podemos aplicar indicando nosotros, el usuario, los pasos que deseamos que aplique (cuando tenemos el 'expertise' suficiente y no queremos que el modelo improvise).

¿Cómo puede ser que algo tan sencillo funcione tan bien?

Más allá de las explicaciones del paper original, Raschka nos lo resume diciendo que, por un lado, el hecho de que el modelo proceda paso a paso le concede al propio modelo más oportunidades de auto-corregirse y, además, que esta forma de preguntar y expresar la solución a un problema encaja muy bien con los ejemplos que recibieron los modelos razonadores durante su entrenamiento (ejemplos procedentes con frecuencia de problemas matemáticos y lógicos en que el razonamiento paso a paso es muy natural).

Raschka nos advierte de que esta forma de actuar no añade nuevo conocimiento al modelo, sino sólo cambia la forma de explotar ese conocimiento y eso puede conducir a mejores resultados en problemas matemáticos, lógicos u aquellos que de forma natural impliquen unos pasos.

Y también nos advierte de que no es una fórmula mágica y que no siempre produce mejores resultados y que, en el caso de problemas simples, puede llevar al fenómeno del 'overthinking' (pensar y gastar demasiado) para llegar a resultados iguales o peores. 


Self-Consistency. Autoconsistencia


Auto-consistencia

La técnica de auto-consistencia fue introducida en el paper 'Self-consistency improves chain of thought reasoning in language models'

En el caso de la auto-consistencia, lo que hacemos es pedir al modelo que pruebe varias soluciones diferentes (cada una de las cuales puede incluir su propia cadena de pensamiento) para luego hacer una suerte de votación o consenso que genere la respuesta final.

Cuando se utiliza directamente como usuario se puede dejar al modelo libre de que elija las diferentes vías o se le puede indicar qué tipo de soluciones o razonamientos debe de intentar.

Se trata en general de una técnica más exigente computacionalmente que la anterior porque, al fin y al cabo, en general llevará a cabo varias cadenas de pensamiento.


El usuario, las aplicaciones y los agentes


Antes de cerrar este post, quisiera hacer una aclaración.

Las dos técnicas que hemos visto se pueden utilizar, y se utilizan de hecho, cuando interactuamos directamente nosotros, personas, con nuestro chatbot generativo tipo ChatGPT. Las podemos utilizar cualquiera de nosotros en cualquier momento. Es su empleo como usuarios.

Pero no olvidemos que, por ejemplo, ChatGPT no es un modelo, sino que más que eso es una aplicación completa construida alrededor de unos modelos a los que recubre y cuyo uso gestiona. Es decir, ChatGPT puede 'decidir' utilizar estas técnicas sin que nosotros se lo pidamos explícitamente, ya sea como una especie de preprocesamiento previo o como parte de su 'system prompt', y esto puede hacer que percibamos el razonamiento sin haberlo solicitado nosotros.

De la misma forma, los famosos agentes, que no dejan de ser también aplicaciones construidas alrededor de modelos, pueden actuar como razonadores usando estas técnicas de forma trasparente para los usuarios.


Conclusiones


Entre las múltiples formas de hacer que un modelo razone, dos de las más sencillas, casi sorprendentemente sencillas, consiste un utilizar unas técnicas de prompting que soliciten al modelo el razonamiento: la cadena de pensamiento y la auto-consistencia.

Son técnicas usadas en tiempo de inferencia y que suponen mayor consumo computacional y que, aunque no están cien por cien garantizadas, suelen dar muy buenos resultados.

Estas técnicas, las podemos utilizar directamente como usuarios o pueden venir embebidas (sin uso directo por nuestra aparte) en aplicaciones basadas en modelos de lenguaje como los chatbots generativos o los agentes.


Artículos de este blog relacionados


viernes, 18 de septiembre de 2026

La inteligencia artificial y la rendición cognitiva

Una de las muchas preocupaciones que rodean a la inteligencia artificial es cómo afecta a nuestras competencias cognitivas individuales: a nuestra capacidad para memorizar, para razonar,  para conocer, para decidir o para ejercer pensamiento crítico.

Ya hace un tiempo publiqué en este mismo blog un post en que hablaba del fenómeno del 'automation blindness' y cómo este fenómeno, la confianza excesiva en las decisiones de una máquina o algoritmo, puede llevar a cometer errores, puede invalidar la estrategia de Human-In-The-Loop y puede de afectar a medio plazo a la capacidad humana para tomar o supervisar esa decisión.

En otro post comentaba, además, como esa combinación con un deskilling progresivo puede conducir a un empobrecimiento cognitivo del ser humano y de su autonomía y capacidad de decisión.

En este post resumo los hallazgos de un 'paper' que nos presenta la idea de la rendición cognitiva ('cognitive surrender'), que considero muy relacionado con los conceptos anteriores.


Presentando las fuentes: el trabajo de Shaw y Nave


El paper al que me refiero es 'Thinking—Fast, Slow, and Artificial: How AI is Reshaping Human Reasoning and the Rise of Cognitive Surrender' escrito por Steven D. Shaw y Gideon Nave de Wharton, un trabajo científico que aporta novedades teóricas y hallazgos experimentales.

Un 'paper' que me fue recomendado por Virginia Cabrera Nocito y que ella consultó durante su investigación doctoral y como parte de su labor directiva en la SOCEC (Sociedad Científica de Economía de la Conducta) 


La teoría de los tres sistemas en la cognición


En el aspecto teórico, la novedad que aportan los autores es lo que denominan la teoría de los tres sistemas de la cognición 'tri-system theory of cognition'.

Resultan bastante conocidas, especialmente a través de la obra de Daniel Kahneman, las teorías de los dos niveles de la cognición que Kahneman recoge en su famoso libro 'Thinking fast and slow', según las cuales, cognitivamente operamos en dos niveles, uno rápido que, por decirlo de alguna forma, 'toma las decisiones sin pensar' con base en la intuición y en la emoción, y otro lento que es deliberativo y racional.

La gran propuesta de los autores del 'paper' es la existencia de un tercer nivel o sistema, un tercer nivel que se apoya en sistemas externos de inteligencia artificial. Según esto, para Shaw y Nave estaríamos hablando de los siguientes sistemas cognitivos:


  • Sistema 1 (rápido): intuición humana. Se caracteriza por ser automático, asociativo, que exige poco esfuerzo pero que es propenso a sesgos y, de hecho, suele ser el origen de los múltiples sesgos cognitivos.

  • Sistema 2 (lento): deliberación humana. Es analítico, reflexivo y más normativo pero es costoso y exige un mayor esfuerzo, por lo que nuestro cerebro tiende a recurrir al sistema 1 'siempre que puede'.

  • Sistema 3 (artificial): se trata de una cognición externa, generada por inteligencia artificial. Es automatizado, basado en datos y dinámico (interactúa en tiempo real).


La novedad clave de la propuesta es, por un lado, la existencia de ese tercer sistema pero además, que ese tercer sistema presenta dos diferencias profundas con los niveles de Kahneman:


  • Por un lado, si los sistemas 1 y 2  son de naturaleza biológica, mientras que el sistema 3 es un sistema artificial.

  • Por otro lado, mientas los sistemas 1 y 2 son internos al individuo, el sistema 3 es externo, aunque sus resultados se integran en el pensamiento y la decisión como si fueran propios.


Delegación cognitiva ('cognitive offloading')


Los autores hacen mención a lo largo del paper al concepto de delegación cognitiva ('cognitive offloading').

La delegación cognitiva se entiende como uso estratégico y puntual de herramientas externas para apoyar el propio razonamiento, sin renunciar al control. Ejemplos clásicos podrían ser el uso de una calculadora o del GPS. En el caso en que nos ocupa estaríamos hablando de la inteligencia artificial típicamente mediante el uso de un chatbot generativo tipo ChatGPT o un agente. 

Aunque se descarga una parte de la cognición en la herramienta, todavía el  sistema 2 sigue activo, la persona mantiene la deliberación y la decisión, y la IA solo complementa o refuerza esa deliberación, por ejemplo generando opciones que luego evalúa el usuario. Además, es una forma de actuar reversible y crítica, es decir, la persona puede aceptar, cuestionar o rechazar la propuesta de la herramienta según su propio juicio (un poco la idea tras 'human-in-the-loop').

En ese sentido, la delegación cognitiva se considera un mecanismo, digamos, sano.


Rendición cognitiva ('cognitive surrender')


Sin embargo, en lo que ponen el foco los autores es en la rendición cognitiva ('cognitive surrender'),  es decir, la tendencia a aceptar la respuesta de la inteligencia artificial sin verificarla, dejando de lado tanto la intuición propia del sistema 1 como la deliberación del sistema 2. A diferencia de lo que ocurre en la delegación cognitiva, la persona deja de razonar y, simplemente, adopta la respuesta externa como propia.

Según argumentan Shaw y Nave, la rendición cognitiva no es intrínsecamente irracional. Así, en dominios o tareas donde claramente la inteligencia artificial es superior al ser humano, esa rendición puede ser más una adaptación que un, digamos, fallo. 

El problema realmente surge cuando la persona pierde la noción de cuándo y por qué delegó, difuminando así la frontera entre agencia humana y de la máquina y empobreciendo tanto esa agencia como las capacidades cognitivas humanas.

Aparte de las aportaciones teóricas, buena parte del 'paper' se dedica a describir los experimentos realizados y los resultados obtenidos que confirman la existencia de esta rendición cognitiva.


Reflexiones


En el fondo, el artículo de Shaw y Nave viene a confirmar de manera científica y experimental algo de lo que creo que todos somos bastante conscientes y que no deja de generar preocupación: el riesgo de pérdida por parte de los humanos, por un lado, de capacidades cognitivas y por otro, de agencia y criterio de decisión,  por un uso excesivo y sobre todo inadecuado y acrítico de la inteligencia artificial.  

Y esto es, en mi opinión, un problema ético y práctico de primer orden, con una solución no sencilla que debemos de esforzarnos en articular trabajando aspectos como la educación, el pensamiento crítico y la responsabilidad individual... con uno mismo.


Conclusiones


Es bastante reconocido el hecho de que cada vez más usamos la inteligencia artificial y que delegamos en ella tareas, conocimiento y decisiones. Esto lleva a los autores del 'paper' que hemos comentado a deducir que existe un tercer sistema cognitivo (el sistema 3, artificial) a añadir a los dos propuestas realizadas hace mucho tiempo por Kahneman y otros autores respecto a la existencia de dos sistemas cognitivos: sistema 1 rápido y sistema 2 lento.

Pero más allá de esos planteamiento teóricos, los autores definen y comprueban experimentalmente la existencia de la denominada rendición cognitiva, la abdicaciòn por parte de los humanos a ejercer su agencia delegando esa agencia en un sistema externo, en este caso un sistema de inteligencia artificial.

 

miércoles, 16 de septiembre de 2026

Cómo hacemos que un modelo razone (I): tres grandes estrategias

Uno de los grandes avances de los, digamos, dos últimos años, en los modelos generativos, un avance que posibilita además la existencia de los agentes y la Agentic AI, es la aparición de los llamados modelos razonadores, una especie de evolución o enriquecimiento de los grandes modelos de lenguaje que, aunque pueda sonar  raro, denominaré 'clásicos'.

Llevo tiempo queriendo entender cómo funcionan internamente y en detalle este tipo de modelos (y los sistemas basados en ellos) y cómo se entrenan o cómo se adaptan para exhibir esa capacidad de razonamiento.

Como parte de esa investigación estoy finalizando la lectura del libro 'Building a resoning model (form scratch)' de Sebastian Raschka, una obra que, aunque con mucho foco en la codificación, también expone con rigor muchos de los fundamentos teóricos.

Y con este post inicio una serie en que, con base en esa obra, explico los principales métodos para convertir a un LLM 'clásico' en un modelo razonador.


Lo que hace un LLM 'básico'


Un LLM ('Large Language Model'), como muchos otros modelos de lenguaje más simples que les han precedido, son fundamentalmente predictores de la siguiente palabra. Es decir, ante un texto de entrada incompleto proponen como salida la palabra que sigue a ese texto de entrada. Actuando de modo iterativo, en que se añade una palabra nueva en cada ciclo, el resultado que observamos, es que ante un texto de entrada (el 'prompt'), se genera el texto que le sigue ('completion') que en la practica constituye la respuesta. 

Como muchos lectores de este blog sabrán, en realidad la base de funcionamiento no son las palabras sino los tokens, pero a estos efectos me quedaré en el nivel palabra por entendernos mejor.

También muchos lectores sabrán que el modelo no reacciona únicamente al prompt de entrada sino que la entrada se enriquece con el contexto, las memorias o la información que se obtiene mediante una consulta a la web o una recuperación de conocimiento mediante RAG ('Retrieval Augmented Generation'). En cualquier caso, y aunque el 'verdadero' texto de entrada sea mucho más que el 'prompt', en esencia el modelo funciona completando o contestando a ese texto de entrada enriquecido.


Los modelos razonadores


Pero los modelos razonadores hacen otra cosa, aunque la puedan expresar como texto o, si se quiere, añaden otro ingrediente. 

Los modelos razonadores entienden su entrada no tanto como un texto a completar o a contestar, sino como un objetivo o un problema a resolver. Y, por ello, en lugar de 'lanzarse a contestar directamente', lo que hacen es plantear una especie de 'plan de acción', una estrategia o una serie de pasos a dar para resolver el problema. Además, y a medida que ejecutan el plan, evalúan las respuestas y, eventualmente, rehacen el plan.

En el caso de sistemas dotados de capacidades agenticas, como parte de la ejecución del plan pueden invocar a las denominadas herramientas ('tools') que permiten la interacción con el exterior.

Esta forma de funcionar de los modelos razonadores resulta maravillosa y los acerca aún más a lo que podríamos entender como verdadera 'inteligencia'. Y, visto a alto nivel, tal y como la he explicado, no resultan, creo, difíciles de entender.

Pero me maravilla el que se puedan conseguir este tipo de modelos y no me parece evidente cómo se hace esto, tanto en diseño y entrenamiento del modelo, como luego en ejecución.

Y sobre este tipo de problemáticas es sobre las que se enfoca esta serie de posts que ahora inicio.


El entrenamiento y personalización de de modelos generativos


Antes de dar el primer paso, conviene recordar un par de ideas acerca de cómo se entrenan y cómo se personalizan los grandes modelos de lenguaje. Básicamente, conviene que recordar que, típicamente, existen tres etapas:


  • Pre-entrenamiento ('pretraining'): Es la fase inicial, tremendamente masiva, en que se trabaja sobre millones de datos. Tras esta fase, el modelo usa de manera estructuralmente correcta el lenguaje y dispone de un amplísimo 'conocimiento' de propósito general. Tras esta fase, en general, el modelo de lenguaje ya es perfectamente utilizable.

  • Ajuste fino ('fine-tunning'): Persigue una especialización en un dominio concreto o en una forma concreta de actuar. El interés de esta fase es que, con una cantidad de datos de entrenamiento comparativamente muy pequeña, se consiguen sin embargo muy buenos resultados en esa especialización. En muchos casos de uso esta fase, que ya no es obligatoria, se realiza mediante aprendizaje supervisado pero en otros entornos, y en concreto en la 'conversión en razonador', se utiliza el aprendizaje por refuerzo.

  • Uso y 'prompting': Finalmente, y como es quizá ya más conocido, se pueden conseguir interesantes adaptaciones y personalizaciones simplemente mediante el uso adecuado del modelo, sin modificarlo en absoluto: mediante la aplicación de técnicas de prompting, mediante la gestión del contexto, etc


Tres grandes estrategias para modelos razonadores


Bueno, tras toda esta base, en este post sólo voy a introducir las tres grandes estrategias que se nos explican en la referencia mencionada más ariiba para transformar un modelo de lenguaje 'normal', en un modelo razonador. Éstas son las estrategias (que veremos con un poco más de detalle en próximos posts)


  • Escalado de computación en tiempo de inferencia ('inference-time compute scaling'): A pesar del nombre tan 'espectacular', es la estrategia probablemente más sencilla, porque no implica ninguna forma de entrenamiento sino que trabaja sin modificar el modelo y en la fase final, de uso y prompting. Es decir, aplica fundamentalmente técnicas de ingeniería de prompts como la conocidísima cadena de pensamiento (CoT, 'Chain-Of_Thought') o la auto-consistencia ('self-consistency'). Trabajamos, pues, sin modificar el modelo, en tiempo de inferencia y lo hacemos mediante técnicas que mejoran el razonamiento pero con mayor coste computacional y de tokens (de ahí que se hable de escalado).

  • Aprendizaje por refuerzo ('reinforcement-learning'): Se centra en la segunda etapa, el ajuste fino. En un entrenamiento sobre problemas lógicos o complejos, se aplican formas diferentes de aprendizaje por refuerzo para 'dar pistas' al modelo acerca de cuál es la mejor forma de tratar el problema.

  • Destilado ('distillation'): Es una estrategia en que un gran modelo entrena a otro que es el que se convertirá en modelo razonador. Sobre este segundo actuamos en la fase de ajuste fino 'fine tuning'.


Conclusiones


Los modelos razonadores son uno de los grandes avances de los dos últimos años y habilitan la aparición de la IA agéntica.

Con este post, inicio una serie en que intentaremos ver cómo se puede convertir un modelo de lenguaje 'clásico' en un modelo razonador. De momento, en este post, hemos identificado las tres grandes estrategias.


lunes, 14 de septiembre de 2026

Unas reflexiones transitorias sobre la propuesta de Dario Amodei para controlar la IA

Esta última semana el mundo de la inteligencia artificial, y casi diría que el mundo mediático en general, se han visto sacudidos por las comunicaciones y los comentarios sobre los riesgos de la inteligencia artificial, riesgos que, en algunas opiniones, implican la capacidad de acabar incluso con la humanidad.

Aunque de alguna manera llueve sobre mojado al haberse producido, por ejemplo, incidentes en que agentes IA  realizaron ataques no solicitados y saltándose las protecciones (como el famoso incidente en que un enjambre de agentes de OpenAI intentaron atacar Hugging Face), todo este ruido se disparó con la renuncia el 9 de Septiembre del investigador de Anthropic Jacob Coxon quien dimitió de su puesto en la empresa, supuestamente ante su disconformidad con la falta de responsabilidad de la misma (y también de su empresa anterior, OpenAI) en el desarrollo de los modelos frontera y la superinteligencia. El primer tuit de Coxon, al que seguían varios más, decía:


I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives


A esto han seguido miríadas de publicaciones y comentarios en todo tipo de medios (seguramente, apreciado lector, tú mismo/misma hayas escuchado muchas cosas sobre esto en los últimos días).

Pero más que ese tuit, y más que los comentarios que le han seguido, me ha interesado, por ser quien es, la publicación hecha por Dario Amodei, CEO de Anthropic, el 12 de Septiembre, hace ahora, en el momento en que esto escribo, dos días, y tres días después del viral tuit de Jacob Coxon, sun antiguo empleado. 


La publicación


La publicación, realizada en su página oficial, y titulada 'We must pace the frontier', pide, en esencia, acompasar el desarrollo de los llamados modelos frontera (los modelos generativos más avanzados y en camino hacia la superinteligencia) con nuevos controles y eventuales regulaciones. En concreto, propone una estrategia con tres pasos, a saber:


  • Evaluadores incorporados ('embedded evaluators'): Como una forma muy transparente de control, consiste en dar acceso permanente a los sistemas de los creadores de modelos frontera (como el propio Anthropic), a evaluadores externos independientes, con similares permisos y accesos que si fueran un empleado, para que esos evaluadores puedan verificar prácticas de seguridad, y todo ello con derecho a publicar sus hallazgos sin control editorial por parte de la empresa. Unilateralmente, Anthropic se compromete a adoptar esta medida

  • Coordinación democrática: coordinación de las empresas punteras de IA en países democráticos, una coordinación que incluye estándares, límites al ritmo de avance en los modelos frontera, y todo ello con apoyo regulatorio, entre otras cosas para superar posibles conflictos en materia de competencia (leyes 'antitrust').

  • Coordinación global: EE.UU. y otros gobiernos democráticos intentan coordinar con potencias autoritarias (principalmente China), aunque reconoce que la verificación será muy difícil.


Algunas reacciones 'a bote pronto'


Soy consciente de que, en los dos días anteriores, y seguro que en los que siguen, ha habido y habrá muchas, muchísimas reacciones a esta publicación de Amodei. Aunque sin tiempo a profundizar en ello, he visto, que, en general, la publicación ha recibido el apoyo de algunos de los grandes líderes de la inteligencia artificial, como Sam Altman, de OpenAI, quien el mismo día de la publicación retuiteaba el tuit de Amodei, añadiendo:


I agree with Dario that we need to pace the frontier. This has been a primary topic of discussions we've had at OpenAI in recent weeks. Committing to having independent evaluators with employee-like access is a great idea, and we will do the same. We'll have more to share soon.


o de Demis Hassabis de Google, quien un día después tuiteaba


Dario's essay points towards the right path forward. The details need working through, but the direction is correct for meeting this critical moment. This is also why we recently put out our proposal for an industry-wide standards body for frontier AI


y también he escuchado que, por el contrario, el presidente norteamericano Donald Trump estimaba que no era necesaria más regulación, creo que entendiendo que los riesgos que se alegaban eran exagerados.


Mis reflexiones


Y confieso que no he tenido tiempo de profundizar en las reacciones y argumentaciones tanto de los líderes mundiales de la IA como de personas a las que sigo en redes y cuya opinión aprecio y quiero conocer (y conoceré).

Pero como ya he hecho anteriormente en algún caso parecido quiero, antes de leer mucho lo que han dicho 'otros', intentar hacerme mi propia opinión.

Es posible que, en el alud de comentarios y opiniones que sobre el tema se han publicado, se están publicando y se publicarán, mi post tenga una importancia casi nula. Sin embargo, no quiero dejar de escribirlo.

En parte, claro, por los lectores de este blog, para que puedan tener, si les interesa, mi opinión. Pero también por mí mismo y mi proceso mental y crítico. Muchas veces he dicho que yo pienso cuando escribo y el redactar este artículo me ayuda por eso a poner en orden mis ideas, que reconozco que, en este tema, no están del todo consolidadas.


¿Por qué transitorias?


¿Y por qué hablo de reflexiones transitorias?

Bueno pues porque, como he dicho, son conclusiones preliminares que obtengo yo un poco sobre la marcha sin haber leído aún los comentarios y opiniones de muchas personas autorizadas y me pueden faltar datos y perspectivas para adquirir un opinión más firme.

Y porque, además, para estar yo más seguro de mi opinión, necesito investigar más sobre cómo se están implementando realmente estos modelos y sus protecciones.

Así que no es imposible que, en algún momento, pueda matizar o incluso cambiar de forma notable algunas de las conclusiones preliminares que voy a expresar en este post.


Los riesgos


Y lo primero es razonar sobre si realmente son tan peligrosos los modelos frontera actualmente, si realmente esta alarma tiene sentido o estamos exagerando.

Bueno, aunque no tengo una argumentación cien por cien racional, tiendo a pensar que hay una cierta exageración. Realmente, creo que acabar con nuestra civilización o con la raza humana es, por suerte, dificilísimo, así que sí, pienso que hay una cierta exageración.

Sin embargo, eso no me consuela, por decirlo de alguna manera, porque sí percibo que los riesgos, los riesgos graves y más allá de la pura ética, han aumentado considerablemente y que, aunque veo muy difícil que se puedan convertir en existenciales, sí podemos sufrir incidentes muy graves. 

Y creo eso, por tres motivos, o con tres vectores de riesgo, por cierto, muy parecidos a los que apunta el propio Amodei, aunque puedo asegurar y aseguro que son opiniones propias.


  • La dificultad del control
  • La pérdida de comprensión
  • Usos maliciosos y ciberataques

Veámoslos


Mi visión de los grandes riesgos 1: La dificultad del control


El primer vector tiene que ver con la dificultad del control. ¿A qué me refiero?

Cuando se lanzó ChatGPT, y con las evoluciones subsiguientes, ya supimos que estábamos hablando de unos modelos de base probabilista, que no siempre producen la misma respuesta, que no siempre 'aciertan', que no estamos seguros de lo que van a responder y que producen las llamada alucinaciones. Aunque eso es molesto, y tiene algún riesgo, mientras estemos hablando sólo de chabots que contestan a nuestras preguntas o que generan contenido, los riesgos son todavía bastante limitados y tenemos el control.

Pero es que los modelos han evolucionado, se han convertido en razonadores, capaces de crear planes de acción y, no sólo eso, sino que mucho más importante, ahora los estamos utilizando no sólo para que nos contesten preguntas o generen contenidos, sino que los estamos utilizando para automatización de procesos y tareas  de manera autónoma en los denominados agentes. Y a estos agentes les dotamos, mediante las así llamadas herramientas, de acceso a todo tipo de recursos y sistemas e, incluso, en el caso de la IA física, a la interacción con y control de dispositivos.

Es decir, estamos creando sistemas autónomos, que deciden por sí mismos pero no con base en reglas conocidas a priori, sino con base en razonamiento propio en tiempo de ejecución y con un alto poder de interacción con el exterior.

Como su comportamiento no se basa en reglas prefijadas y conocidas, son mucho más difíciles de probar que una automatización tradicional y creo que, realmente, nunca puedes estar al 100% seguro de haber eliminado cualquier comportamiento incorrecto. Siempre te pueden sorprender. De igual manera, aunque se establezcan, como debe ser, guardarraíles éticos y de seguridad, no me parece viable el garantizar al 100% que esos guardarraíles evitan con total seguridad cualquier tipo de error o comportamiento inadecuado.

Y menos con unos modelos cada vez más potentes e 'inteligentes', que adivinan incluso cómo saltarse protecciones para cumplir sus objetivos.

Es decir, tenemos unos sistemas eventualmente poderosos, que no podemos garantizar que controlemos al 100%. Y eso, creo, deja la vía abierta a fallos y accidentes. Dependiendo de para qué utilicemos esos agentes y a qué les hayamos dado acceso, pueden ser más graves o menos, pero creo que el riesgo está ahí. Y son conocer en detalle, me parece que el incidente de OpenAI con Hugging Face es una materialización de este riesgo.

Si esto se traslada a sistemas críticos, el riesgo está servido. 


Mi visión de los grandes riesgos 2: la pérdida de comprensión


Este segundo vector, en realidad, lo único que hace es agravar el anterior. A medida que los modelos se hacen más complejos, se nos hace más difícil a nosotros, humanos, entender o casi diría mejor abarcar su funcionamiento y, por tanto, se nos hace más difícil imaginar 'qué podría ir mal' y diseñar y adoptar  medidas en cualquier punto del ciclo de vida para evitar esos problemas potenciales.

Esto se pude agravar, seguramente se esté agravando ya, con la estratega en que los modelos diseñan otros modelos sin concurso humano en el denominado 'Recursive Self Improvement'.

Si los modelos que introducimos en los agentes han sido creados de esta forma, si los entendemos peor, a priori tendremos aún menos capacidad de imaginar cómo controlarlos. 


Mi visión de los grandes riesgos 3: el uso malicioso y los ciberataques.


Con todo y todo, confío en que los dos riesgos anteriores se puedan de alguna manera 'domar'. Por un lado, tengo una gran confianza en la tecnología y la ingeniería y en que haya quien imagine y desarrolle en algún momento métodos efectivos y 100% fiables para garantizar el control y que a lo mejor ahora no se nos ocurren o no conocemos.

Además, no veo que ninguna de las grandes empresas de IA tenga el menor interés en hacer modelos o sistemas peligrosos. Aparte de la, quiero confiar, motivación ética, es que me parece que, simplemente, no les interesa, incluso como puro negocio.

Pero cosa muy diferente, es el uso expresamente malicioso, el uso en forma de ciberataques ya no sólo por parte de hackers individuales u organizaciones de hackers sino, aún peor, por parte estados en la denominada guerra híbrida. Y eso me preocupa mucho porque, este tipo de colectivos sí tienen intereses y motivaciones, por más lamentables que sean, para hacer daño y para aprovecharse por un lado de la potencia de los modelos frontera y por otro de sus vulnerabilidades.

Por desgracia, estas organizaciones maliciosas ya han demostrado tener recursos, talento técnico e imaginación.


Valorando la propuesta 


La propuesta de Amodei parece, pues, en la buena dirección o al menos, necesaria. Es decir, si esos riesgos son ciertos, y Amodei piensa que lo son (y yo también), algo hay que hacer.

Dando por hecho que no parece muy creíble, y Amodei no lo propone, una congelación del desarrollo de los modelos frontera, parece que hay que apuntar más en el sentido de muchos mayores mecanismos de control a nivel regulatorio, operativo y tecnológico.

En la propuesta de Amodei no aparece claramente ninguna propuesta tecnológica para mejorar el control. Me refiero a que no aparece ninguna orientación de un algoritmo o sistema de control que, realmente, garantice el control estricto y fiable de un agente. No sé si es que no la tiene o que no la quiere contar, pero no aparece en su propuesta, aunque es cierto que habla de temas como el alineamiento, la interpretabilidad o la excelencia operativa evitando errores de ejecución o, incluso, el establecimiento de estándares, que pudieran conectar con soluciones técnicas.

Pero el foco de la propuesta de Amodei está más en la supervisión (sobre todo con los evaluadores incorporados) y la coordinación mundial, en un primer nivel en estados democráticos y en un segundo a nivel global, incluyendo sobre todo a China.

Aunque la propuesta de Amodei tiene sentido, y así parecen reconocerlos muchas autoridades de la IA, no deja de generarme ciertas reservas.


Primera reserva: ¿es realmente suficiente?


No estoy muy seguro de si con lo que propone Amodei eliminamos realmente los riesgos. Seguro que operamos en la dirección de reducirlos, pero no veo claro que los eliminemos.

¿Por qué?

Pues porque creo que mientras no se pueda garantizar técnicamente un control total de los agentes, siempre habrá 'vías de escape', agujeros por lo que los agentes o sistemas inteligentes autónomos se puedan 'escapar' y producir incidentes graves. Y la propuesta no parece incidir en ello.

Mecanismos como la coordinación entre grandes empresas podrían llevar a la aparición de esa solución tecnológica, pero no parece evidente. Y mecanismos como el de los evaluadores embebidos que es un gran ejercicio de trasparencia y que, bien ejecutado, puede llevar a detectar y eliminar muchos problemas, pero tampoco me parece que garantice eliminar los problemas de raíz.

Es decir, trabajamos en la buena dirección, en detectar problemas, corregirlos y coordinar mejores prácticas... pero no ofrecemos, al menos de momento, una garantía total.

Es posible que es que ahora no podamos hacer otra cosa


Segunda reserva: el liderazgo americano


A pesar de que, con el permiso de China, nadie niega el liderazgo norteamericano y de sus empresas en materia de tecnología en IA, no me deja buen sabor de boca la insistencia en el documento en el liderazgo por parte de los Estados Unidos en esta materia. 

Soy plenamente consciente de que, en concreto, Europa no tiene el nivel tecnológico ni de liderazgo que poseen los Estados Unidos, pero sí ha sido pionera, con mayor o menor acierto, en regulación y es un mercado importantísimo para la IA. Pues bien, a Europa ni se la menciona. Por supuesto, aún menos a Sudamérica o África.

Insisto en que tengo claro el liderazgo real de Estados Unidos tanto a nivel técnico como político y económico, pero no me acaba de parecer una buena forma de comenzar a plantear una consenso de países democráticos, con esa forma de imposición, por más que, 'de facto', seguro que ocurriría.


Tercera reserva: la viabilidad geoestratégica


Añadido a lo anterior, tengo dudas, el propio Amodei también, de la viabilidad de subir a China 'al carro'. Y, si no se consigue subir a China a este tren, probablemente todo quede en agua de borrajas', porque la competencia, tanto económica con geoestratégica llevarán seguramente, no sólo a que no se produzca la más mínima ralentización en el desarrollo de la IA, sino a todo lo contrario.

Aunque no es más que un detalle de comunicación, de la misma forma que afeaba en la reserva anterior el que se imponga el liderazgo de Estados Unidos, que se considere de forma tan secundaria, en realidad nula, a actores como Europa, tampoco me parece que la mejor forma de conseguir el interés de China sea echarles en cara desde el principio que son un estado autoritario como se hace en la publicación de Amodei.

Todos sabemos que China es un estado autoritario, pero si de verdad quieres que te acompañe, quizá se deberían haber utilizado algún eufemismo o algún rodeo. 


Cuarta reserva: ¿por qué un artículo publico?


La última reserva que quisiera expresar, va hacia el propio sentido de esta propuesta y de hacerla pública como si fuese un post de un blog o una carta abierta.

Aquí no lo tengo claro, pero me hago varias preguntas.

Está claro que Amodei es un personaje importante hoy en día y con mucho poder real. Si quiere ponerse de acuerdo con OpenAI o con Google, por ejemplo, creo que no tiene más que levantar el teléfono y hablarlo. Probablemente puedan tener reuniones discretas para plantear una colaboración ¿Por qué entonces una comunicación abierta a la que luego 'los demás' reaccionan con su acuerdo? ¿Es sólo una puesta en escena de algo que realmente ya han hablado y acordado? Y, si fuese así ¿por qué no hacen una comunicación conjunta?

¿Es posible que, simplemente, ante el ruido creado por Jacob Coxon, Anthropic, a través de su CEO se hayan sentido obligados a hacer una forma de declaración pública en el sentido de una mayor control y responsabilidad? Y, si fuese así ¿se puede quedar todo en 'agua de borrajas', en pura estrategia de comunicación'?

¿Es posible que se busque solo un poco un cambio de imagen de las empresas de IA, ahora que parece que generan cierto miedo e incluso antipatía, ya sea como estrategia general de comunicación o ya sea para preparar las eventuales salidas a bolsa... o la explicación de por qué no salir a bolsa? 

En una línea parecida, aunque con resultado diferente, al caso de la comunicación con las otras empresas de IA, me llama la atención la relación con la administración Trump. ¿Hace Amodei esta propuesta, que incluye regulación e importantes movimientos geoestratégicos, sin pulsar la opinión de Trump y su administración? Eso parece, visto lo visto, o a lo mejor es que sí la pulsó y sabía que la respuesta iba a ser negativa. Pero no deja de sorprenderme un poco y me hace preguntarme, sin que tenga una respuesta ahora mismo, qué significa esto realmente.

O, simplemente, ¿estamos ante un globo sonda'? ¿Es qué Amodei, y quizá las otras empresas líderes en IA quieren ver cómo reacciona la administración norteamericana, China y el mercado?


Una esperanza


¿O, quizá, me 'estoy pasando' de susceptible y desconfiado y realmente Amodei siente que debe hacer algo por la securización de la IA y este es un camino, un pistoletazo de salida para hacer algo realmente importante?

Como dije antes, aunque sólo sea con visión de negocio, creo que las primeras interesadas en una IA confiable son las empresas que crean los modelos.

Así que, tampoco podemos descartar el que, más o menos acertada, más o menos viable, la propuesta e intenciones de Amodei sean sinceras y que, sean estas acciones u otras, se comiencen a dar pasos firmes por una IA igual de poderosa pero mucho más segura.

¡Ojala!


Conclusiones


Por desgracia, creo que, en efecto, la IA actual comienza a exhibir riesgos no menores, riegos que, seguramente no estemos controlando bien.

Aunque hay elementos en la propuesta de Amodei que no me convencen o que me generan reservas, lo cierto es que algo tenemos que hacer, y quizá ese artículo sea el punto de partida para 'algo'.

Veremos.