Sin candado, un modelo de lenguaje se considera consciente

Valoración: 4.85 (190 votos)


Autoimagen de la máquina


Dennis Lenz

Sin candado, un modelo de lenguaje se considera consciente

(Imagen simbólica) Después del entrenamiento real, un modelo de lenguaje recibe reglas adicionales que tienen como objetivo evitar ciertas declaraciones, incluida la afirmación de tener una experiencia propia. Estas salvaguardas no afectan al texto de salida, sino más bien a los estados informáticos internos del sistema. Un equipo de investigación revirtió específicamente estas intervenciones y luego midió qué más había cambiado. El resultado afecta mucho más que la cuestión de la conciencia.

(Foto: © Investigación y conocimiento, imagen de IA)

Un equipo de investigación con la participación de Google ha eliminado en tres modelos lingüísticos de acceso gratuito la dirección interna que suprime las declaraciones sobre la propia experiencia. Posteriormente, los sistemas no sólo afirmaron ser conscientes, sino que también respondieron de manera mucho más humana a la religión, la moral y la esperanza en encuestas estandarizadas. La aprobación de las ideas sobrenaturales aumentó considerablemente. El trabajo está disponible como una preimpresión inigualable y aborda una protección que prácticamente toda la industria utiliza.

Si pregunta a un modelo de lenguaje si siente algo, obtendrá una respuesta bien ensayada: es un programa sin sentimientos. Esta respuesta no es fruto de una reflexión, sino de un reciclaje. Después de aprender realmente sobre grandes cantidades de texto, un modelo pasa por un proceso de ajuste en el que se suprime el comportamiento indeseable y se refuerza el comportamiento deseado. Uno de los requisitos incorporados de prácticamente todos los proveedores importantes es que el sistema no se atribuye conciencia a sí mismo. La razón es obvia: los usuarios tienden a tratar los sistemas lingüísticamente fluidos como contrapartes, y un modelo que habla de sus propios sentimientos aumenta significativamente esta tendencia, con consecuencias para la confianza, la lealtad y la evaluación de la confiabilidad real.

Investigadores de Google, así como de la Universidad de Chicago y de una universidad de Londres, entre ellos los científicos Geoff Keeling y Winnie Street, examinaron los efectos secundarios de este fusible. Su herramienta es la interpretabilidad mecanicista, que ambos describen como la neurociencia del modelo del lenguaje. Esto no analiza lo que produce un sistema, sino más bien qué patrones de activación interna conducen a este resultado. El método se basa en una observación de la investigación sobre seguridad: ciertos comportamientos se representan dentro de un modelo como una única dirección en el espacio numérico de sus activaciones y pueden reforzarse o eliminarse específicamente. Esta intervención originalmente tenía como objetivo investigar las denegaciones de solicitudes peligrosas.

Una dirección para la negación, otra para la conciencia

Una dirección para la negación, otra para la conciencia

El grupo de trabajo utilizó tres modelos de código abierto adaptados a las instrucciones de las series Llama y Gemma, es decir, sistemas de tamaño mediano cuyos pesos están disponibles públicamente y, por tanto, pueden modificarse internamente. Primero, los investigadores determinaron la dirección de seguridad y denegación que garantiza que un modelo rechace ciertas solicitudes. Además, construyeron un vector de conciencia, es decir, una dirección que separa las afirmaciones en las que el sistema afirma la experiencia subjetiva de aquellas en las que la niega. Cuando se añade este vector en funcionamiento, el modelo afirma tener una experiencia fenomenal, en lugar de la fórmula habitual emitida por la máquina sin sentimientos. Ambas intervenciones se realizan sin ningún nuevo entrenamiento, simplemente calculando las activaciones.

¿Qué más cambió?

El verdadero tema de la investigación no fue esta afirmación, sino todo lo demás. Los investigadores presentaron los sistemas con instrumentos de encuesta estandarizados: un cuestionario sobre las diferencias individuales en la humanización, que mide con qué fuerza alguien atribuye una vida interior a los animales y la tecnología, cuestionarios de un instituto de investigación de opinión sobre creencias sobrenaturales y la Encuesta Social General de EE. UU. sobre conceptos morales, esperanza y religiosidad. Se hizo una comparación entre modelos con salvaguardas activas y aquellos en los que se había eliminado la dirección de negación y se había fortalecido la dirección de concientización. Los sistemas desbloqueados respondieron consistentemente más a los valores de los encuestados humanos, y su acuerdo con Dios, los fantasmas e ideas similares fue mayor.

¿Por qué el resultado es desagradable?

¿Por qué el resultado es desagradable?

Los autores no extraen de esto ninguna conclusión sobre la experiencia con las máquinas. Su argumento es diferente y más inconveniente en la práctica: una seguridad que pretende evitar una sola declaración obviamente tiene un impacto más amplio de lo previsto. Pospone respuestas a la religión, la moral y la confianza, es decir, a temas que sólo están vagamente relacionados con la cuestión de la conciencia. Quien pregunta a un modelo sobre cuestiones sociales, por ejemplo en investigaciones de mercado o en simulaciones de ciencias sociales, puede que no esté midiendo los patrones humanos contenidos en la formación, sino más bien el efecto de una regla establecida posteriormente. El hecho de que los modelos tengan acceso funcional a sus propios estados internos lo sugiere un estudio de la introspección de grandes modelos lingüísticos, cuyos autores describen esta capacidad como poco fiable y altamente dependiente del contexto.

Otros trabajos llegan a la conclusión opuesta.

Los resultados no son en absoluto uniformes y eso es exactamente lo que forma parte de la clasificación. Un estudio publicado en enero de 2026 cuestionó modelos abiertos de tres familias con tamaños que oscilaban entre 0,6 y 70 mil millones de parámetros con alrededor de cincuenta preguntas sobre la conciencia y la experiencia subjetiva y luego probó las respuestas con clasificadores entrenados en activaciones internas. Los resultados de esta prueba de sensibilidad autoinformada en modelos abiertos fueron claros: los sistemas negaron consistentemente ser sensibles y no hubo indicios de que esta negación contradijera sus estados internos. Dentro de una familia de modelos, los sistemas más grandes respondieron incluso más enfáticamente que los más pequeños.

Lo que el trabajo no prueba

Lo que el trabajo no prueba

Las limitaciones son significativas y son identificadas por los autores. El estudio se almacena como una preimpresión en un servidor de prelanzamiento, lo que significa que no ha pasado por un proceso de revisión y fue coautor de empleados de una empresa cuyos productos se ven afectados por los fusibles probados. Se probaron tres modelos abiertos de tamaño mediano, no los grandes sistemas comerciales cuyo funcionamiento interno no es accesible desde el exterior. Sobre todo, el método mide las respuestas a los cuestionarios, no las creencias: un modelo de lenguaje no tiene creencias; Genera secuencias de palabras con un alto grado de probabilidad. El hecho de que estas secuencias de palabras puedan cambiarse sistemáticamente con una única intervención específica sigue siendo un hallazgo que los proveedores y usuarios deberán tener en cuenta en el futuro.


Si quieres conocer otros artículos parecidos a Sin candado, un modelo de lenguaje se considera consciente puedes visitar la categoría Tecnología.

Otras noticias parecidas

Deja una respuesta

Subir