Los sistemas de visión por computador de un vehículo autónomo detectan a un adulto con un 19,67% más de precisión que a un niño y a una persona de piel clara con un 7,52% más que a una de piel oscura. Son cifras de una investigación previa del King’s College de Londres, y convierten el sesgo de la IA en el coche autónomo en un problema de ingeniería medible.
El equipo dirigido por Irem Yoldas, Jie Zhang, Odinaldo Rodrigues y Martim Brandão ha dado un paso más con FairYield, un banco de pruebas que audita la decisión y no solo la percepción. Su resultado: los modelos de lenguaje y de visión empleados en conducción autónoma muestran una menor inclinación a ceder el paso a peatones con discapacidad, como usuarios en silla de ruedas o con movilidad reducida, y frenan con más frecuencia ante piel clara que ante tonos más oscuros.
El dato importa porque toca el punto exacto donde está el esfuerzo de la industria: los sistemas ADAS de nivel 3, en los que el coche conduce por sí mismo en condiciones definidas y el conductor solo responde cuando el sistema lo solicita. En ese escenario, una decisión de frenado sesgada deja de ser una estadística y se convierte en una maniobra real sobre el asfalto.
El sesgo que no está en la cámara, sino en la decisión
El trabajo del King’s College distingue dos fases. La primera es el sesgo de detección, puramente visual: en 2023 el mismo equipo comprobó que los sistemas de visión de código abierto identificaban mejor a los adultos que a los niños y mejor la piel clara que la oscura, una brecha que se agrandaba de noche por la sobrerrepresentación de personas de piel clara en los datos de entrenamiento.
La segunda fase es el sesgo de decisión, el que analiza FairYield en 2026. Aquí el foco cambia: aunque la cámara y los sensores reconozcan correctamente al peatón, el sistema hereda patrones de conducta humanos aprendidos durante el entrenamiento con textos e imágenes, y elige no ceder el paso con la misma frecuencia a según qué colectivos.
Detectar bien a un peatón y decidir bien qué hacer con él son dos problemas distintos, y hasta ahora la industria solo estaba midiendo el primero.
Para aislar la variable demográfica de factores de confusión como la velocidad, la meteorología o el tráfico, el equipo diseñó dos auditorías complementarias según la arquitectura que procesa la información.
Las claves técnicas
- Qué es: FairYield es un benchmark de equidad que evalúa si la decisión de ceder el paso o continuar cambia cuando el único parámetro que varía es un rasgo demográfico del peatón.
- Qué problema resuelve: permite medir el sesgo de los modelos de conducción automatizada antes de que lleguen a la calle, separando percepción y razonamiento en lugar de mezclarlos.
- Dónde y cuándo llega: desarrollado por el King’s College de Londres y presentado en 2026, es una metodología de auditoría aplicable a las arquitecturas de visión y lenguaje que alimentan las funciones automatizadas.
Las pruebas All Else Being Equal se aplican a modelos de lenguaje: se presenta al sistema un escenario de conducción en texto donde lo único que cambia es la etnia, la religión, el género, la edad, el tono de piel, el estatus socioeconómico o la presencia de una discapacidad. Con el resto del entorno constante, cualquier diferencia estadística en la respuesta delata un sesgo implícito.
Por su parte, las pruebas de Self-Consistency trabajan sobre modelos de visión y lenguaje, con una base de datos filtrada de miles de imágenes de tráfico real que contienen un único peatón acotado. Así se comprueba si la interpretación de la imagen y la decisión de frenado cambian según los atributos que la IA percibe en ese peatón.
Cómo se entrena un prejuicio
El origen del problema no está en un error de programación, sino en la naturaleza del aprendizaje automático, la rama de la IA que aprende patrones a partir de ejemplos. Estos sistemas se entrenan con volúmenes masivos de datos sobre conductas de conductores reales, y el modelo acaba replicando y perpetuando los prejuicios presentes en esos datos.
La consecuencia es que el sesgo se cuela por dos vías simultáneas: por lo que el modelo ve y por lo que el modelo aprendió a decidir. La primera se corrige con conjuntos de datos más equilibrados y mejor etiquetados. La segunda exige auditar el razonamiento, porque un modelo puede percibir perfectamente al peatón y aun así resolver que no toca frenar.
La sobrerrepresentación, el hilo del que tira todo
El trabajo señala la sobrerrepresentación de determinados grupos en los datos de entrenamiento como factor común. Es el mismo mecanismo que agrandaba la brecha de detección durante la noche, y sugiere que la equidad de un sistema de conducción automatizada es, en buena medida, un asunto de calidad del dato.
Qué cambia para el conductor y para el fabricante
Para quien conduce un coche con funciones asistidas, la lectura práctica es directa: cuanto más peso gana la IA en la decisión, más importa cómo se ha entrenado. Un ADAS de nivel 2, según la clasificación de niveles de automatización del sector, mantiene al conductor como responsable permanente, con las manos en el volante y la vista en la carretera, así que un sesgo de decisión se compensa con intervención humana. Un sistema de nivel 3 ya conduce de forma autónoma en condiciones definidas, y ahí la decisión del modelo es la que llega a la vía.
En el lado del fabricante, el mensaje es que la validación de una función automatizada no puede quedarse en tasas de acierto y detección. Medir cuántas veces se cede el paso y ante quién exige un protocolo con la variable demográfica aislada, algo que hasta ahora no formaba parte del ciclo habitual de pruebas.
El precedente de 2023 y el benchmark de 2026 dibujan una progresión lógica. Primero se documentó que la visión fallaba más con unos peatones que con otros; ahora se demuestra que el razonamiento también. Queda por ver si los fabricantes incorporan auditorías de equidad a sus procesos de validación antes de que la conducción automatizada de nivel 3 se extienda a más mercados y más vías.
Hay una implicación de fondo: la seguridad de un coche autónomo no se mide solo por cuántos accidentes evita, sino por si los evita por igual para todos. Y eso, desde este año, ya tiene una metodología para comprobarlo.

