Los chatbots de IA suelen parecer particularmente seguros cuando dan respuestas incorrectas

★★★★★Valoración: 4.86 (178 votos)


mira adentro


Dennis Lenz

Los chatbots de IA suelen parecer particularmente seguros cuando dan respuestas incorrectas

(Imagen simbólica) Los chatbots de IA a veces dan respuestas incorrectas con gran certeza y, a la inversa, dudan de las correctas. Investigadores de la Universidad de California en Riverside han examinado lo que sucede dentro de los modelos de lenguaje. Por tanto, la confianza en uno mismo y la corrección están controladas por diferentes características internas. Esto abre caminos para hacer que los modelos sean más cautelosos cuando es probable que estén equivocados.

(Foto: © Investigación y conocimiento, imagen de IA)

Los chatbots con IA suelen dar respuestas incorrectas con gran confianza y, por el contrario, advierten de la incertidumbre aunque sean correctas. Investigadores de la Universidad de California en Riverside han descubierto el motivo. En los modelos lingüísticos examinados, la confianza y la corrección están controladas por diferentes características internas. Por tanto, la confianza de un modelo no es una indicación fiable de si su respuesta es correcta.

Grandes modelos de lenguaje como ChatGPT, Gemini o Llama responden millones de preguntas todos los días, desde tareas hasta planificación de viajes y preguntas sobre salud. Suelen formular sus respuestas con fluidez y convincentemente, independientemente de si son correctas. Por lo tanto, los usuarios a menudo se orientan por el tono de voz: si un modelo parece seguro, es más probable que crean en la respuesta; si expresa duda, es más probable que lo cuestionen. Sin embargo, es precisamente esta suposición la que resulta problemática. Los modelos de lenguaje producen repetidamente declaraciones falsas, las llamadas alucinaciones, y las presentan con el mismo tono seguro de sí mismo que las correctas. Por el contrario, un modelo puede expresar dudas aunque su respuesta sea correcta. Este es un problema clave para los desarrolladores porque los modelos de lenguaje preparan cada vez más decisiones y completan tareas de forma independiente. Necesita mejores formas de determinar cuándo las respuestas de una IA son confiables y cuándo no. Por ello, un equipo dirigido por el informático Het Patel de la Universidad de California en Riverside examinó el interior de los modelos lingüísticos.

Los investigadores examinaron dos modelos de lenguaje abierto cuyos procesos internos pueden analizarse desde el exterior: Llama-3.1-8B de Meta y Gemma-2-9B de Google. Presentaron a ambos modelos preguntas de opción múltiple y clasificaron las respuestas en cuatro grupos dependiendo de si eran correctas o incorrectas y si el modelo parecía seguro o inseguro. Luego utilizaron herramientas llamadas codificador automático disperso para descomponer la actividad interna de los modelos e identificar qué características se activan durante qué comportamiento, como describe la Universidad de California Riverside en su anuncio del 23 de septiembre. Estos codificadores automáticos traducen los patrones numéricos difíciles de entender de una red neuronal en características individuales más fáciles de interpretar. Esto permite observar qué bloques de construcción se iluminan en el modelo cuando responde a una pregunta y si estos bloques de construcción difieren entre respuestas seguras e inciertas.

Donde los chatbots de IA separan la seguridad y el conocimiento

Donde los chatbots de IA separan la seguridad y el conocimiento

El resultado central: la confianza en uno mismo y la corrección surgen de diferentes características internas en los modelos examinados. Las características asociadas con un desempeño seguro se superponen sólo parcialmente con las asociadas con las respuestas correctas. Por lo tanto, ambas propiedades pueden divergir, y esto es exactamente lo que explica los dos patrones de error típicos. En un caso, la característica de seguridad está activa aunque falta la base de conocimientos para la respuesta y el modelo afirma un error con confianza. En el otro caso, el modelo es correcto, pero el dispositivo de seguridad sigue siendo débil, lo que genera dudas innecesarias. Los investigadores ven esto como una contradicción con la suposición generalizada de que la confianza de un modelo es un indicador confiable de la exactitud de sus respuestas. Para los usuarios, esto significa: Un tono confiado dice poco sobre si una respuesta es correcta. Sigue siendo esencial comprobar las declaraciones importantes basadas en fuentes fiables.

Ajustar las características internas de manera específica

El descubrimiento no es sólo una explicación, sino que también podría conducir a una solución. Si la seguridad y la corrección dependen de características internas separadas, es posible que se pueda influir específicamente en estas características. El objetivo sería un modelo que actúe con confianza cuando tiene razón y se vuelva más cauteloso cuando es probable que esté equivocado. Patel también ve el enfoque como un método general: los investigadores podrían buscar características internas asociadas con otros comportamientos deseables o indeseables y ver si estos pueden fortalecerse o debilitarse mediante intervenciones. Estas intervenciones específicas en la actividad interna de los modelos lingüísticos se consideran una herramienta prometedora para hacer que los sistemas de IA sean más transparentes y controlables. El trabajo apareció como una publicación previa en el servidor de preimpresión arXiv y aún no ha sido revisado por revisores independientes. Inicialmente, los resultados sólo son válidos para los dos modelos comparativamente pequeños examinados.

Por qué es peligrosa la sobreestimación de la IA

Por qué es peligrosa la sobreestimación de la IA

La cuestión de qué tan bien una IA evalúa su propia incertidumbre se vuelve más importante cuanto más responsabilidad asumen los modelos de lenguaje. En medicina, derecho o asesoramiento financiero, una declaración falsa y segura de sí misma puede causar daños considerables si se acepta sin control. Esto es especialmente complicado en el caso de los llamados agentes de inteligencia artificial, que realizan varios pasos de trabajo de forma independiente, uno tras otro. Una señal de seguridad falsa determina si un error se detecta a tiempo o si se traslada al siguiente paso. Otros grupos de investigación también están trabajando para hacer que los modelos de lenguaje sean más honestos acerca de su incertidumbre. Investigadores del MIT demostraron en primavera que ciertos procedimientos de entrenamiento llevan a los modelos a responder cualquier pregunta con un alto grado de certeza porque son recompensados ​​por las respuestas correctas y castigados por las incorrectas, sin tener en cuenta los matices. El trabajo de Riverside complementa esta visión con una explicación de lo que sucede en el interior de las maquetas.

Qué pueden sacar los usuarios de él

El estudio tiene algunas implicaciones prácticas para la vida cotidiana con chatbots. El tono de una respuesta no es señal de calidad; una declaración formulada con especial firmeza no merece automáticamente más confianza que una cautelosa. Cuando estén involucradas cuestiones de salud, dinero o legales, las respuestas de los modelos lingüísticos deben compararse con fuentes independientes. También puede resultar útil volver a hacer la misma pregunta a un chatbot de forma diferente y comparar las respuestas, porque los resultados contradictorios indican incertidumbre. Los investigadores de Riverside ahora quieren trasladar su enfoque a modelos más grandes y otros tipos de tareas. Si se confirma que la confianza en uno mismo y la corrección pueden estar específicamente alineadas, los futuros chatbots podrían indicar más claramente cuándo se puede confiar en ellos. Hasta entonces, la investigación crítica sigue siendo la mejor protección contra los errores de confianza cometidos por la inteligencia artificial.

arXiv, ¿La incertidumbre y la corrección del LLM están codificadas por las mismas características? Una disociación funcional a través de codificadores automáticos dispersos; doi:10.48550/arxiv.2604.19974


Si quieres conocer otros artículos parecidos a Los chatbots de IA suelen parecer particularmente seguros cuando dan respuestas incorrectas puedes visitar la categoría Tecnología.

Otras noticias parecidas

Deja una respuesta

Subir