Grupo ICC
Tecnologia • 19 de septiembre de 2026

Cómo medir si un piloto de inteligencia artificial funciona en una Administración pública

Expedientes administrativos atravesando un banco de pruebas con instrumentos de medición y validación humana.

Un piloto de inteligencia artificial puede producir resultados sorprendentes durante una presentación y, aun así, no resolver ningún problema relevante. Que una herramienta resuma un expediente, clasifique documentos o redacte una respuesta en pocos segundos demuestra una capacidad técnica. No demuestra todavía que pueda integrarse con seguridad en el trabajo cotidiano de una Administración pública.

La pregunta decisiva no es si la inteligencia artificial funciona, sino si mejora el proceso para el que ha sido probada. Eso exige comparar sus resultados con la situación anterior, contabilizar también el trabajo de revisión y comprobar que el equipo puede utilizarla sin perder control sobre las decisiones.

En distintos contextos administrativos aparecen dificultades parecidas: tareas documentales que consumen muchas horas, información distribuida entre varios sistemas, procedimientos condicionados por requisitos jurídicos y equipos con niveles desiguales de experiencia tecnológica. La consecuencia es clara: un piloto solo tiene valor cuando aborda un problema acotado, respeta el criterio profesional y produce evidencias que permitan decidir qué hacer después.

Medir primero el proceso que se quiere mejorar

Antes de incorporar una herramienta conviene describir cómo funciona actualmente el procedimiento. Qué personas intervienen, qué documentos consultan, dónde buscan la información, qué comprobaciones realizan y en qué puntos se producen esperas, errores o repeticiones.

No hace falta convertir esta fase en una auditoría interminable. Una línea de base sencilla puede registrar cuánto tiempo requiere completar una tarea, cuántas fuentes deben consultarse, qué correcciones son habituales y qué parte del recorrido exige verdadero juicio profesional. Sin esa referencia, cualquier resultado rápido puede parecer una mejora, aunque después genere más trabajo de comprobación.

El alcance también debe quedar delimitado. Un piloto puede ayudar a localizar antecedentes, comparar documentos, clasificar solicitudes, preparar un borrador o señalar información ausente. Otra cosa muy distinta es interpretar una norma, validar una resolución o adoptar una decisión administrativa. Establecer qué puede hacer el sistema y qué permanece bajo responsabilidad humana protege el procedimiento y facilita su evaluación.

La prueba debería realizarse sobre un conjunto de casos suficientemente variado para revelar no solo los aciertos, sino también los límites. Los resultados deben revisarse con los mismos criterios profesionales que se aplicarían al trabajo ordinario. El objetivo no es conseguir una demostración perfecta, sino descubrir cómo se comporta la solución ante documentos incompletos, excepciones, instrucciones ambiguas o información desactualizada.

Cinco dimensiones para evaluar un piloto de IA pública

La primera dimensión es la utilidad operativa. No basta con medir cuánto tarda el sistema en generar una respuesta. Hay que calcular el tiempo total necesario para obtener un resultado válido, incluida la comprobación, la corrección y la incorporación al expediente. Una respuesta inmediata que obliga a rehacer el trabajo puede ser menos eficiente que el procedimiento anterior.

La segunda es la calidad. Conviene evaluar si el resultado es completo, conserva el sentido de los documentos, identifica correctamente las fuentes y evita errores u omisiones relevantes. Una pauta de revisión definida antes de comenzar permite distinguir entre resultados aceptables, resultados corregibles y respuestas que deben rechazarse.

La tercera es la trazabilidad. El equipo debe poder conocer qué información utilizó la herramienta, qué versión de los documentos consultó, qué transformaciones realizó y quién revisó el resultado. En la Administración, poder reconstruir el proceso es tan importante como la velocidad obtenida.

La cuarta dimensión es la adopción real. Asistir a una formación o completar una demostración no significa que una solución haya sido incorporada al trabajo. Hay que observar si las personas la utilizan, para qué tareas la consideran útil, dónde encuentran dificultades y si saben detectar cuándo una respuesta no es fiable. El aprendizaje del equipo forma parte del resultado del piloto.

La quinta es la capacidad de mantenimiento. Al finalizar la prueba debe estar claro quién actualizará las fuentes, gestionará permisos, revisará incidencias y ajustará el sistema cuando cambien los procedimientos. Si la solución solo funciona mientras permanece el equipo externo que la construyó, se ha obtenido un prototipo interesante, pero no una capacidad sostenible.

Estas dimensiones no tienen el mismo peso en todos los proyectos. Un asistente para consultar manuales internos puede admitir un nivel de riesgo diferente al de una herramienta que interviene en expedientes sensibles. Por eso los indicadores deben definirse en función del proceso, de sus usuarios y de las consecuencias que tendría una respuesta incorrecta.

Medir un piloto no consiste en buscar argumentos para justificar su continuidad. También debe permitir abandonarlo, reducir su alcance o rediseñarlo. Una evaluación útil ofrece a la organización cuatro salidas legítimas: detener, corregir, ampliar la prueba o preparar la implantación.

Grupo ICC trabaja este recorrido desde el proceso y no desde la fascinación por la herramienta: identificación del problema, definición de una línea de base, construcción de un caso acotado, revisión humana e indicadores de decisión. Así, la inteligencia artificial deja de ser una demostración prometedora y se convierte en una mejora evaluable, gobernable y conectada con el funcionamiento real de la Administración.