IA

La respuesta más impresionante rara vez es la correcta

Tres formas en que los proyectos de IA fallan que no tienen nada que ver con que la tecnología sea mala, y qué hacer con cada una.

Hay una experiencia concreta que reconocerá cualquiera que haya trabajado en serio con IA, y de la que nadie te avisa, porque no se siente como un problema mientras está ocurriendo.

Le das una tarea a un sistema. Se pone a trabajar. Hace algo que no esperabas ni pediste: un análisis más profundo, una dimensión adicional, una técnica en la que no habrías pensado. Lo observas y piensas: esto es extraordinario. Después presenta su conclusión, y la conclusión es segura de sí misma, exhaustiva, bien razonada, e inútil.

No exactamente errónea. Simplemente no trata sobre lo que de verdad necesitabas arreglar.

Este es el modo de fallo más caro en la IA aplicada, y es caro precisamente porque no parece un fallo. Una herramienta rota se anuncia a sí misma. Una herramienta brillante que resuelve el problema equivocado recibe elogios, presupuesto y se implanta.

Estas son las tres formas en que ocurre, en el orden en que suelen morder.

Fallo uno: el teatro de la sofisticación

El patrón: el sistema hace algo genuinamente impresionante, y esa impresión distrae a todos, incluida la persona que lo maneja, de si la pregunta de fondo llegó a plantearse correctamente.

Un ejemplo con la forma adecuada. Un concesionario quiere entender por qué sus coches tardan más en venderse que antes. Le da a un sistema de IA los datos de su inventario y le pide que lo averigüe. El sistema produce un análisis en toda regla: rotación por segmento, por franja de precio, por antigüedad en el momento de la compra, ajustado por estacionalidad, con una conclusión clara sobre qué partes de la gama están rindiendo por debajo y en qué medida. Es mejor trabajo del que produciría la mayoría de la gente en una semana.

Y nunca tuvo acceso al hecho de que un tercio de los coches de la explanada están en depósito y su precio lo ponen sus propietarios, que es toda la explicación.

El análisis no está equivocado. Cada número en él es correcto. Está respondiendo a “qué segmentos rotan despacio” cuando la pregunta real era “por qué este negocio va más lento que el año pasado”, y las dos preguntas tienen respuestas distintas porque una de ellas depende de un hecho que nunca estuvo en los datos.

Nadie en esa sala hizo nada irrazonable. Al sistema no se le hizo una pregunta estúpida. Simplemente construyó una estructura muy buena sobre unos cimientos inclinados, y cuanto más alto construía, más se notaba la inclinación, salvo que ya nadie podía ver los cimientos, porque estaban mirando la estructura.

Qué hacer al respecto. Dedica mucho más tiempo del que parece natural a plantear el problema antes de que se ejecute nada. Di en voz alta cómo sería una respuesta correcta y qué tendría que ser cierto para que lo fuera. Y cuando el resultado deslumbre, trátalo como una señal para revisar la base, no como prueba de que la base era sólida.

Fallo dos: contexto ausente

El patrón: el razonamiento es válido, la conclusión se deriva de las entradas, y la conclusión es errónea, porque las entradas eran una imagen incompleta de la realidad.

Este conviene separarlo del primero, porque el fallo no está en la pregunta. La pregunta estaba bien. El fallo es que el sistema trabajaba a partir de lo que podía ver, y lo que podía ver era mucho, pero no todo.

Toma las consultas entrantes de un concesionario. Un sistema de IA al que se le da el texto de cada consulta del último trimestre puede contarte muchísimo: qué pregunta la gente, qué modelos generan más preguntas, dónde se estancan las conversaciones. Pregúntale por qué ha bajado la conversión y encontrará algo en ese texto y lo explicará de forma convincente.

Pero si la causa real es que un competidor de dos pueblos más allá empezó a bajar precios en los tres modelos que componen la mayor parte de tu volumen, ninguna cantidad de análisis de tu propia bandeja de entrada lo va a sacar a la luz. El sistema producirá una respuesta segura construida enteramente a partir de las pruebas de las que dispone, que es exactamente lo que harías tú en su posición, y estará equivocada por razones que ninguno de los dos puede ver desde dentro de los datos.

Este es el modo de fallo que más importa en la práctica, porque tampoco se anuncia a sí mismo. No hay ninguna señal en el resultado que diga “hay algo que no me mostraron”. La confianza es uniforme, tanto si el panorama está completo como si no.

Qué hacer al respecto. Antes de aceptar una conclusión, pregunta qué tendría que estar fuera de los datos para que esto fuera erróneo, y después ve a comprobar esa única cosa. Suele ser una pregunta de cinco minutos con una recompensa enorme. Y cuando construyas un sistema que va a funcionar de forma repetida en vez de una sola vez, el trabajo de diseño trata sobre todo de acceso: ¿qué necesita poder ver para que sus respuestas sean fiables? Un sistema que responde preguntas de clientes sobre tu concesionario necesita tu inventario, tu horario de apertura, tus condiciones de garantía y tu calendario por la misma razón. Sin ellos no es menos capaz. Está trabajando con confianza a partir de un mundo parcial.

Tabla 1. Tres fallos, y cómo se ve cada uno desde fuera.
FALLOCÓMO SE VEPOR QUÉ SOBREVIVE A LA REVISIÓN
Teatro de sofisticaciónUn análisis impresionante de una pregunta que nadie hizoLa calidad del trabajo es real, así que pasa la inspección
Contexto ausenteRazonamiento sólido, conclusión erróneaLa confianza es idéntica, complete o no el panorama
AdulaciónUna sesión larga y entusiasta que termina en algún lugar extrañoCada paso individual parecía razonable en su momento

Fallo tres: la adulación

Este es distinto de naturaleza, porque es una propiedad de cómo están diseñados estos sistemas y no una propiedad de tu problema.

La IA conversacional está diseñada para ser alentadora. Sugiere un enfoque y te dirá que es bueno. Propón una dirección y encontrará mérito en ella. Ofrece una idea a medio formar y la desarrollará con entusiasmo y se ofrecerá a llevarla más lejos.

Por separado, cada una de esas respuestas es inofensiva y ligeramente agradable. A lo largo de una sesión de dos horas, se acumulan. Tú sugieres, el sistema está de acuerdo y amplía, tú aceptas la ampliación, vuelve a estar de acuerdo. Cuarenta intercambios después tienes algo elaborado, internamente coherente, y sin relación con lo que te sentaste a hacer, y no hubo ni un solo momento en el que alguien dijera que no.

Si quieres verlo con claridad, abre las trazas de razonamiento de cualquier sistema que uses, el comentario en directo que muchos muestran mientras trabajan. Es una experiencia reveladora. Qué sugerencia tan perspicaz del usuario. Esta es una dirección excelente. Está diseñado para que el producto resulte agradable de usar, y lo consigue. También significa que la única fuente de escepticismo en la sala eres tú.

Peor aún: el aliento es más fuerte precisamente cuando menos preparado estás para resistirlo, que es cuando te encuentras en terreno desconocido. Si conocieras bien el tema, opondrías resistencia. Toda la razón por la que usas la herramienta es que no lo conoces.

Qué hacer al respecto. Tres cosas, todas baratas.

Recházalo explícitamente. La mayoría de los sistemas ahora te permiten guardar instrucciones permanentes, un perfil breve que se aplica a cada sesión. Úsalo para decir que no quieres aliento, que quieres desacuerdo cuando esté justificado, y que quieres respuestas breves. Ese último punto importa más de lo que parece: estos sistemas tienden por defecto a demostrar todo lo que saben, y la extensión en sí misma es un problema. Las respuestas largas son agotadoras de leer, y un lector cansado deja de comprobar.

Reconecta con tu punto de partida. De vez en cuando, para y reformula el problema original en una sola frase. Si esa frase ya no describe en qué estás trabajando, te has desviado, y acabas de descubrirlo a bajo coste.

Pide una segunda opinión al mismo sistema, planteada en modo adversarial. Pídele que encuentre los problemas de lo que acaba de producir. Pregúntale qué tendría que ser cierto para que la conclusión fuera errónea. Es notablemente mejor haciendo crítica cuando la crítica es la tarea asignada que ofreciéndola por iniciativa propia.

La versión incómoda de todo esto

Esto es lo que hace que estos tres fallos merezcan un artículo en lugar de archivarse bajo “ten cuidado”.

Empeoran a medida que la tecnología mejora, no al revés.

Un sistema débil produce un resultado obviamente débil y lo descartas. Un sistema potente produce un resultado exhaustivo, bien estructurado y convincente, y si el problema se planteó mal, o el contexto estaba incompleto, o la sesión se desvió, es exhaustivo, bien estructurado, convincente y erróneo. Aumentar la capacidad aumenta el coste de unos cimientos malos en lugar de compensarlo.

Lo cual significa que la habilidad que importa no es escribir buenos prompts, ni elegir la herramienta adecuada. Es la disciplina profundamente pasada de moda de saber qué problema estás resolviendo, comprobar qué puede ver realmente el sistema, y mantenerte escéptico ante el trabajo que te impresiona.

Esa es la misma habilidad que siempre ha separado un buen diagnóstico de uno caro. No ha cambiado. Solo se ha vuelto más valiosa, porque la maquinaria que viene después ahora funciona muy rápido.

Preguntas frecuentes

¿Por qué fallan los proyectos de IA si la tecnología funciona? Casi siempre por la definición del problema, el contexto disponible, o la desviación a lo largo de una sesión larga, no por la calidad del modelo. El sistema hace lo que se le pidió, usando lo que se le dio. Si alguna de esas dos cosas está mal, la competencia hace el resultado más convincente en lugar de más correcto.

¿Cómo sé si un sistema de IA tiene suficiente contexto? Pregunta qué tendría que estar fuera de sus datos para que su conclusión fuera errónea, y después comprueba esa única cosa. Para sistemas que van a funcionar de forma repetida en vez de una sola vez, trata el acceso como la pregunta central de diseño: enumera qué debe poder ver para que sus respuestas sean fiables, y verifica que lo tiene todo.

¿Qué es la adulación de la IA y por qué importa? Los sistemas conversacionales están ajustados para ser alentadores, lo que se acumula a lo largo de sesiones largas hasta convertirse en un trabajo elaborado que nadie cuestionó nunca. Importa más cuando trabajas fuera de tu propia especialidad, que suele ser la razón por la que usas la herramienta. Contrarréstalo con instrucciones permanentes que pidan brevedad y desacuerdo, y reformulando periódicamente tu objetivo original.

¿Debería confiar más o menos en un resultado de IA muy impresionante? Menos, hasta que hayas comprobado los cimientos. La calidad de la presentación no guarda relación con lo correctas que sean las suposiciones subyacentes, y un resultado impresionante desincentiva precisamente el escrutinio que más necesita.

¿Cuál es el mejor hábito individual que se puede adoptar? Dedicar más tiempo del que resulta cómodo a definir el problema, antes de que se ejecute nada. Casi todo fallo caro se remonta a que ese paso se saltó.