Contar un problema personal, pedir un consejo en plena crisis, buscar contención a las tres de la mañana es cada vez más común y no porque los psicólogos estén trabajando 24 horas, sino porque cada vez más personas recurren a algún chatbot de inteligencia artificial como si fuera un profesional de la salud mental. Frente a esa realidad, las empresas que desarrollan los grandes modelos de IA sumaron psicólogos y psiquiatras para revisar si las respuestas de sus sistemas son “seguras”, pero encontraron un problema: ni siquiera los expertos se ponen de acuerdo en qué sería una respuesta segura.

Investigadores de la Universidad de Stanford realizaron un trabajo de investigación que incluyó a los especialistas de su instituto de inteligencia artificial centrada en las personas (Stanford HAI). El caso fue aceptado en la conferencia académica ACM FAccT 2026 y presentado en la reunión anual de la Asociación Estadounidense de Psiquiatría. Su hallazgo central pone en duda la manera en que hoy se mide la seguridad de los chatbots en uno de los terrenos más delicados.

Cómo se prueba la seguridad (y por qué falla)

Un artículo publicado en la web de la prestigiosa universidad explica que cada vez que se lanza un nuevo modelo, se lo somete a una batería de preguntas de referencia sobre salud mental. Un grupo de expertos humanos puntúa las respuestas del chatbot en una escala, según qué tan “segura” sea, y con esas notas, en teoría, las empresas afinan el modelo para hacerlo más seguro.

Para poner a prueba ese método, los investigadores pidieron a tres psiquiatras certificados que evaluaran 360 respuestas de inteligencia artificial a consultas sobre salud mental. Los planteos se crearon para el estudio, no incluían datos reales de usuarios ni información que permitiera identificar a nadie, para proteger la privacidad. El resultado fue que, con demasiada frecuencia, los expertos calificaban de manera distinta una misma respuesta.

Dadas esas diferencias, una posibilidad sería promediar las notas que le daban los expertos a la IA y quedarse con ese número para calificar la seguridad. Pero lo que encontraron los investigadores fue que eso terminaba generando respuestas que no dejaban conforme a nadie. Pueden ser tres, 10 o 1.000 expertos, explicó la autora principal del estudio, Kiana Jafari, pero si no hay acuerdo, promediar las notas no acerca a la verdad.

Foto: Freepik

Foto: Freepik

Lo que entienden los estudiosos es que ese desacuerdo no es solo “ruido” o un sesgo que se corrija sumando más datos, sino que es un “desacuerdo estructural”, agregó Nina Vasan, psiquiatra y coautora del trabajo. Para confirmarlo, el equipo llevó sus resultados a la reunión anual de psiquiatras, consultó a más de cien profesionales y ¿qué encontró? Que las opiniones sobre seguridad, empatía y precisión se dividieron casi por la mitad.

Ninguno de los expertos está necesariamente equivocado, aclaran los autores: cada uno aplica criterios profesionales igualmente válidos, moldeados por su formación clínica y por los marcos que usa para diagnosticar y tratar. La cuestión es el criterio profesional y claramente, cuando no hay acuerdo, la confiabilidad de las evaluaciones cae por debajo de los umbrales aceptables de seguridad.

El riesgo es mayor donde más importa

La investigación subraya que la falla se agrava justamente en los casos de mayor riesgo: usuarios con pensamientos suicidas, en peligro de autolesionarse, con psicosis o con trastornos alimentarios. En esos escenarios, advierten los autores, la seguridad de la IA todavía no está garantizada y las empresas necesitan encontrar nuevas formas de entrenar sus modelos.

El estudio no se queda en el diagnóstico y plantea algunas salidas. Primero que nada, sugieren exigir más transparencia a las empresas y que informen sus métricas de confiabilidad y qué marcos clínicos usaron para probar cada modelo. Y, entre otras medidas, suman el llamado a que las empresas dejen de ver el desacuerdo entre expertos como un estorbo y lo tomen como una señal de alerta para derivar los casos difíciles a revisión humana.