El manual de E-ARI
Una guía completa de la plataforma: qué hace, cómo funciona y por qué está construida así.
Versión 1.0 · mayo de 2026
Prólogo
La mayoría de las herramientas de «preparación para la IA» son hojas de cálculo disfrazadas. Hacen unas cuantas preguntas, dibujan un gráfico radial y le entregan un PDF que envejece en el momento en que su dirección financiera lo lee.
E-ARI se construyó para hacer algo más difícil: convertir la realidad desordenada, regulada y cambiante de la adopción de la IA en la empresa en un único espacio de trabajo vivo donde la medición, las pruebas y el cumplimiento se acumulan con el tiempo. Un número en un cuadro de mando es fácil. Una pista de auditoría defendible que sobreviva a la revisión de un organismo notificado dentro de tres años, no.
Este documento explica cada parte de la plataforma: el motor de evaluación que califica su preparación, los seis agentes de IA que convierten puntuaciones en relato, el autopiloto de cumplimiento que asigna sus sistemas de IA al Reglamento de IA de la UE, y la capa de supervisión que vigila nuevas lagunas mientras usted duerme.
Léalo de principio a fin o vaya directamente a la sección que necesite. Al final hay un glosario por si algún término le resulta poco familiar.
Índice
- Qué es E-ARI
- El problema que resolvemos
- Cómo está estructurado E-ARI
- Capa 1 — El motor de evaluación
- Capa 2 — Los seis agentes de IA
- Capa 3 — El autopiloto de cumplimiento
- Capa 4 — Supervisión continua
- El recorrido del usuario en cuatro pasos
- Metodología y puntuación
- Privacidad, seguridad y tratamiento de datos
- Planes y precios
- A quién va dirigido
- Hoja de ruta
- Glosario
1. Qué es E-ARI
E-ARI —abreviatura de Enterprise AI Readiness Index— es una plataforma orientada al Reglamento de IA de la UE que ayuda a una organización a responder cuatro preguntas, por orden:
| Pregunta | Respuesta de E-ARI |
|---|---|
| ¿Qué madurez tenemos en la adopción de la IA? | Una puntuación de preparación sobre 8 pilares, comparada con su sector. |
| ¿Qué obligaciones se aplican a nuestros sistemas de IA? | Una clasificación automática del riesgo por sistema de IA (artículos 5 / 6 / 7 + anexo III), con una lista de obligaciones por sistema. |
| ¿Tenemos las pruebas que lo respalden? | Un repositorio de pruebas tipado con extracción automática de cláusulas, que vincula cada prueba con las obligaciones que sustenta. |
| ¿Qué ha cambiado esta semana? | Resumen semanal de cumplimiento + registro de cambios normativos + recordatorios automáticos antes de los plazos de atestación. |
El resultado no es un PDF de una sola vez. Es un espacio de trabajo vivo: puntuaciones, evaluaciones de impacto sobre derechos fundamentales, documentaciones técnicas, informes de lagunas y cobertura de obligaciones se mantienen versionados, exportables y listos para auditoría.
2. El problema que resolvemos
2.1 El panorama del cumplimiento cambió en 2024
El Reglamento de IA de la UE entró en vigor el 1 de agosto de 2024 con aplicación escalonada, modificado por el Digital Omnibus sobre IA (Reglamento (UE) 2026/1744, en vigor el 27 de julio de 2026):
- 2 de febrero de 2025 — se aplican los artículos 5 (prácticas prohibidas) y 4 (alfabetización en materia de IA).
- 2 de agosto de 2025 — gobernanza, obligaciones sobre modelos de IA de uso general, sanciones y designación de organismos notificados.
- 2 de agosto de 2026 — se aplican las obligaciones de transparencia del artículo 50 (las personas deben saber que interactúan con una IA, y el contenido generado por IA debe marcarse).
- 2 de diciembre de 2026 — dos prohibiciones adicionales (imágenes íntimas no consentidas; material de abuso sexual infantil) y obligaciones de marcado para sistemas de contenido sintético ya en el mercado antes del 2 de agosto de 2026.
- 2 de diciembre de 2027 — se aplican las obligaciones de alto riesgo a los sistemas autónomos del anexo III. El Digital Omnibus aplazó esta fecha desde el 2 de agosto de 2026: es tiempo adicional de construcción para una evaluación de impacto y un expediente técnico del anexo IV, no un motivo para esperar.
- 2 de agosto de 2028 — obligaciones de alto riesgo para la IA integrada en productos regulados (anexo I).
Las sanciones llegan a 35 M€ o el 7 % del volumen de negocios mundial por infringir las prácticas prohibidas. No existe una versión «ya lo veremos el trimestre que viene» de esto.
2.2 Las herramientas actuales fallan de tres formas previsibles
| Modo de fallo | Qué aspecto tiene | Qué le cuesta |
|---|---|---|
| Modelos de madurez en hoja de cálculo | Cuatro colores en una pestaña, copiada entre equipos cada trimestre. | Sin control de versiones, sin defendibilidad, sin vínculo con pruebas reales. |
| Proyectos de las grandes consultoras | Un informe de 200 páginas, exacto el día en que se entrega. | Coste alto, cadencia baja: para cuando llega la evaluación siguiente, el panorama normativo se ha movido. |
| Plataformas GRC genéricas | Módulos de cumplimiento con una casilla genérica de «IA» añadida sobre la marcha. | Sin tratamiento nativo de la evaluación de impacto sobre derechos fundamentales (artículo 27) ni del expediente técnico del anexo IV. Sin clasificador de riesgo. Sin vinculación de pruebas a nivel de cláusula. |
2.3 Qué optimiza E-ARI
Tres propiedades que tratamos como innegociables:
- Defendibilidad: cada recomendación, cada clasificación y cada laguna es trazable hasta una cláusula de un reglamento, una frase de una prueba o una pregunta de la evaluación. Sin veredictos opacos de un modelo de lenguaje.
- Acumulación: el trabajo hecho en un sitio alimenta el siguiente. Su evaluación de referencia clasifica sus sistemas de IA. Una prueba subida para una obligación se vincula automáticamente con otras. Cerrar una laguna en un sistema actualiza la supervisión de toda la cartera.
- Disciplina de alcance: deliberadamente no intentamos ser una herramienta de gestión de proyectos, un gigante del GRC ni un registro de modelos. E-ARI se sitúa entre su equipo de estrategia y sus autoridades de control.
3. Cómo está estructurado E-ARI
La plataforma está construida como cuatro capas que cooperan. Cada capa tiene su propio modelo de datos, sus propias superficies de interfaz y sus propios puntos de integración, pero comparten una única fuente de verdad.
| Capa | Nombre | Componentes |
|---|---|---|
| 04 | Supervisión continua | Chequeos de pulso · Radar de lagunas · Registro de cambios normativos · Resúmenes por correo |
| 03 | Autopiloto de cumplimiento | Registro de sistemas de IA · Clasificador de riesgo · Repositorio de pruebas · Generador de evaluaciones de impacto · Generador de expedientes técnicos · Paquete de presentación |
| 02 | Seis agentes de IA | Puntuación · Insight · Discovery · Informe · Literacy · Asistencia |
| 01 | Motor de evaluación | 8 pilares · 40 preguntas · puntuación ponderada · niveles de madurez |
Una evaluación de referencia es el cristal germinal. A partir de ahí, cada sistema de IA que registre queda vinculado a esa referencia, de modo que su perfil de cumplimiento hereda automáticamente el contexto organizativo (sector, tamaño, madurez de gobernanza).
4. Capa 1 — El motor de evaluación
4.1 Los 8 pilares
Puntuamos la preparación sobre ocho pilares, con ponderaciones derivadas de la literatura de investigación sobre factores de éxito en la adopción de IA. Las ponderaciones suman 1,00.
| # | Pilar | Ponderación | Qué mide |
|---|---|---|---|
| 1 | Estrategia y visión | 15 % | Estrategia de IA formal, respaldo directivo, medición del retorno, hoja de ruta plurianual. |
| 2 | Datos e infraestructura | 15 % | Calidad de los datos, accesibilidad, gobernanza, madurez ETL/MLOps, capacidad de cómputo. |
| 3 | Tecnología y herramientas | 12 % | Plataformas de ML, utillaje del ciclo de vida de modelos, diversidad de proveedores, arquitectura en la nube. |
| 4 | Talento y competencias | 13 % | Canal de contratación, formación interna, definición de roles, planes de sucesión. |
| 5 | Gobernanza y ética | 15 % | Comités de ética, integridad de las políticas, auditoría de sesgos, rendición de cuentas. |
| 6 | Cultura y cambio | 10 % | Psicología de la adopción, gestión del cambio, comunicación, manejo de resistencias. |
| 7 | Procesos y operaciones | 10 % | Integración en flujos de trabajo, reingeniería de procesos, bucles de retroalimentación, gestión de SLA. |
| 8 | Seguridad y cumplimiento | 10 % | Seguridad de modelos, controles de privacidad, alineación normativa, preparación para auditorías. |
Cada pilar contiene exactamente 5 preguntas en escala de Likert (1–5). 40 preguntas en total. Tiempo mediano de realización: unos 15 minutos.
4.2 Niveles de madurez
Una vez ponderada, la puntuación global (0–100) se asigna a uno de cuatro niveles:
| Nivel | Rango | Interpretación |
|---|---|---|
| Rezagado | 0–25 | Elementos fundacionales mínimos. Las iniciativas de IA son puntuales o inexistentes. |
| Seguidor | 26–50 | Preparación en fase temprana. Algunas iniciativas, pero sin cohesión ni alineación. |
| Perseguidor | 51–75 | Preparación en progreso. Cimientos colocados, inversión activa en marcha. |
| Referente | 76–100 | Preparación avanzada. Bien posicionado para una ventaja competitiva impulsada por la IA. |
Los niveles son deliberadamente más amplios que un percentil: están pensados para dirigir conductas (dónde invertir), no para halagar.
4.3 Qué recibe a cambio
Una evaluación completada produce un registro Assessment estructurado:
- Puntuación global (0–100, ponderada por sector) y puntuación de referencia (sin ponderar) por transparencia
- Puntuaciones por pilar con desglose a nivel de pregunta y los ajustes de interdependencia aplicados
- Nivel de madurez con una interpretación en lenguaje claro
- Hallazgos X-Ray: patrones estructurales de riesgo detectados a partir de combinaciones de respuestas (véase §9.4), cada uno con gravedad, rastro de pruebas, impacto de negocio y una acción concreta
- Aplicación de la ponderación sectorial: qué pilares se acentuaron para su sector y por qué
- Comparación sectorial (sus puntuaciones frente a medias sectoriales curadas)
- Matriz de fortalezas y debilidades: los tres mejores pilares y los tres últimos
- Mapeo normativo inicial: los pilares que se alinean con las normas aplicables (RGPD, Reglamento de IA de la UE, ISO 42001, NIST AI RMF)
- Análisis de palanca: se vuelve a ejecutar la cadena mejorando cada respuesta un escalón, ordenando cada movimiento posible por su ganancia exacta en la puntuación global (incluida la liberación de reglas de interdependencia y la ponderación sectorial), más una ruta voraz simulada hacia el siguiente nivel de madurez
Este registro es la semilla de todo lo demás. Lo esencial: los hallazgos X-Ray son aquello en lo que cada agente posterior ancla su relato, de modo que el informe que recibe queda amarrado a sus patrones estructurales concretos y no a una redacción genérica de sus cifras.
5. Capa 2 — Los seis agentes de IA
Cuando termina una evaluación, un orquestador ejecuta una cadena de seis agentes. Cada agente tiene una única tarea, y las salidas de los agentes anteriores alimentan las entradas de los siguientes.
La cadena se ejecuta en cuatro etapas secuenciales:
| Etapa | Agentes | Modo | Papel |
|---|---|---|---|
| 1 | Puntuación | Secuencial · se ejecuta primero | Aritmética determinista: produce la base numérica |
| 2 | Insight + Discovery | Paralelo | Se ejecutan a la vez, ya que sus entradas no se solapan |
| 3 | Informe | Secuencial · compila | Reúne las salidas de las etapas 1 y 2 en el documento directivo |
| 4 | Literacy | Secuencial · adaptativo | Currículo personalizado según los pilares más débiles |
| — | Asistencia | Bajo demanda | Diálogo interactivo, disponible tras la cadena |
5.1 Agente de puntuación
Determinista, sin intervención de un modelo de lenguaje, se ejecuta primero. Recorre una cadena de ocho pasos:
- Validar: cada pregunta requerida está respondida, contando como respuesta una anotación «No lo sé» o «No aplicable»; un pilar con menos de tres de sus cinco preguntas valoradas se rechaza (
E_INSUFFICIENT_PILLAR_COVERAGE), y uno sin ninguna valoración se rechaza comoE_NO_PILLAR_COVERAGE - Normalizar: cada pilar se lleva de su suma de Likert a 0–100, sobre las preguntas realmente valoradas: los límites siguen al número de respuestas, de modo que una pregunta anotada ni baja el pilar ni lo infla
- Ajustar: se disparan seis reglas documentadas de interdependencia entre pilares (§9.2)
- Compuesto de referencia: se conserva el global sin ponderar por transparencia
- Ponderación sectorial: las ponderaciones de los pilares se reequilibran para el sector de la organización y se renormalizan a 1,0 (§9.3)
- Componer y clasificar: puntuación global final, nivel de madurez, marcas de fallo crítico
- Detección X-Ray: ocho detectores estructurales recorren las combinaciones de respuestas (§9.4). Un detector cuyas entradas declaradas incluyan una pregunta anotada no se ejecuta y se informa como «no se pudo evaluar», nunca como uno que se ejecutó y no encontró nada
- Simulación de palanca: se vuelve a ejecutar toda la cadena elevando cada respuesta un escalón, produciendo una ordenación exacta de la ganancia de puntuación de cada mejora posible y una ruta voraz simulada al siguiente nivel. Como el motor es determinista, son hechos reproducibles y no estimaciones: la misma propiedad que permite a un cliente auditar su puntuación le permite auditar su hoja de ruta
La aritmética de puntuación es abierta y reproducible. Es el único paso determinista de la cadena: todos los demás agentes anclan sus salidas en este resultado de puntuación y en sus hallazgos X-Ray, lo que significa que las alucinaciones de un modelo de lenguaje no pueden mover su puntuación, y el relato no puede alejarse de sus patrones estructurales reales.
5.2 Agente Insight
Impulsado por un modelo de lenguaje, genera análisis narrativos anclados en el resultado de puntuación. Para cada pilar:
- Una interpretación de la puntuación en lenguaje de negocio, de dos o tres frases
- Dos riesgos concretos si la puntuación se queda donde está
- Dos oportunidades concretas que desbloquea alcanzar el siguiente nivel de madurez
Las salidas pasan por un verificador de anclaje: las afirmaciones que no se vinculan a una puntuación numérica del resultado se eliminan antes de mostrarse.
5.3 Agente Discovery
Se ejecuta en paralelo con Insight, ya que sus entradas no se solapan. Discovery responde a la pregunta «¿qué aspecto tiene realmente su organización vista desde fuera?»:
- Clasifica automáticamente su sector con una llamada de 30 tokens a un modelo de lenguaje (sin contaminación entre sectores)
- Recoge señales públicas mediante Tavily Search y Extract (noticias recientes, presentaciones ante reguladores, patrones públicos de contratación)
- Sintetiza una nota contextual: tendencias del sector, anuncios de homólogos, presión normativa observada
- Las citas van en línea,
[S1],[S2]: sin fuente, no hay afirmación
Si la señal pública es débil o poco fiable, Discovery renuncia a sintetizar en lugar de fabricar una lectura «de confianza media».
5.4 Agente de informe
Compila todo lo anterior en un documento directivo estructurado:
- Resumen ejecutivo (una página, ponderado por su contexto sectorial)
- Análisis pilar por pilar con hallazgos y riesgos
- Las tres acciones recomendadas, cada una ligada a pilares y obligaciones concretos
- Sección de comparación con el contexto sectorial de Discovery
- Anexo: respuestas completas, notas de metodología, mapeo normativo
Disponible como vista en la aplicación, descarga .docx y PDF optimizado para impresión.
5.5 Agente Literacy
Adaptativo, se ejecuta después del informe. Observa sus pilares más débiles y arma un minicurrículo personalizado:
- Artículos específicos del hub Literacy
- Cuestionarios calibrados a su nivel de madurez
- Rutas de aprendizaje recomendadas (p. ej. «De Seguidor a Perseguidor en gobernanza»: 4 módulos, unas 3 horas)
A diferencia de una base de conocimiento estática, Literacy nunca recomienda contenido de pilares en los que ya es fuerte. Se gana su sitio en la cadena por ser personalizado.
5.6 Agente de asistencia
Bajo demanda, tras la cadena. Una interfaz de diálogo anclada con acceso de solo lectura a su evaluación, sus sistemas de IA, sus pruebas y su cobertura de obligaciones.
- Se le pregunta: «¿Qué nos impide ser Perseguidor?»
- Se niega a responder preguntas fuera de su ámbito de datos (sin asesoramiento general sobre IA: solo lo anclado en el estado de su plataforma)
- Todas las citas enlazan de vuelta a registros concretos de su cuenta
6. Capa 3 — El autopiloto de cumplimiento
Aquí E-ARI deja de ser una herramienta de medición y pasa a ser un motor de defendibilidad. El autopiloto de cumplimiento asigna sus sistemas de IA al Reglamento de IA de la UE y produce las piezas que una autoridad de control (o su propia auditoría interna) pedirá.
6.1 El registro de sistemas de IA
Cada sistema de IA que opere o despliegue se registra con:
- Nombre y finalidad: descripción en lenguaje claro
- Rol de despliegue: proveedor, responsable del despliegue, importador, distribuidor (determina qué obligaciones se aplican)
- Sector y poblaciones afectadas: guía la lógica de clasificación del riesgo
- Vínculo con su referencia de preparación: hereda automáticamente su contexto organizativo
Una sola cuenta puede registrar sistemas ilimitados en los planes Growth y Enterprise.
6.2 El clasificador de riesgo
Para cada sistema registrado se ejecuta un clasificador frente a la taxonomía de riesgo del Reglamento:
| Nivel de riesgo | Desencadenante | Qué generamos |
|---|---|---|
| Prohibido (art. 5) | Prácticas subliminales o de explotación, puntuación social, identificación biométrica remota en tiempo real en espacios públicos | Orientación de cese, con los artículos citados |
| Alto riesgo (art. 6 + anexo III) | Componentes de seguridad, biometría, educación, empleo, servicios esenciales, aplicación de la ley, etc. | Expediente técnico completo del anexo IV + evaluación de impacto sobre derechos fundamentales + plan de vigilancia poscomercialización |
| Riesgo limitado (art. 50 / 52 / 53) | Chatbots, ultrafalsificaciones, reconocimiento de emociones, categorización biométrica | Kit de obligaciones de transparencia (plantillas de aviso, textos de divulgación) |
| Riesgo mínimo | Todo lo demás | Lista ligera de obligaciones (alfabetización, adhesión voluntaria a códigos) |
Cada clasificación llega con una justificación: los artículos concretos que activaron el nivel, la orientación pública que los interpreta y la ambigüedad residual (para que su DPD pueda anularla si la posición de la autoridad evoluciona).
6.3 El repositorio de pruebas
Un almacén de objetos tipado para pruebas de cumplimiento:
- Contratos, evaluaciones de impacto de protección de datos, fichas de modelo, documentación de conjuntos de datos, registros de formación, auditorías de seguridad, informes de equidad, etc.
- Pruebas de nivel organizativo (válidas para todos los sistemas) y pruebas por sistema
- Versionadas: sustituir una prueba crea una versión nueva, y la anterior sigue vinculada a las evaluaciones de impacto históricas
- Almacenadas en Vercel Blob con acceso privado; URL prefirmadas para descarga (unos 5 minutos de validez)
Al subir un archivo ocurren dos cosas automáticamente:
- Clasificación: un modelo de lenguaje categoriza el tipo de documento (evaluación de impacto, ficha de modelo, informe de auditoría, etc.)
- Extracción de cláusulas: el documento se trocea y un modelo de lenguaje identifica qué cláusulas o frases corresponden a qué artículo del Reglamento. Esas correspondencias se guardan como
EvidenceClausey quedan reutilizables entre obligaciones.
Una evaluación de impacto que suba para un sistema puede satisfacer automáticamente partes de tres obligaciones distintas en dos sistemas.
6.4 El generador de evaluaciones de impacto sobre derechos fundamentales (artículo 27)
Para los sistemas de alto riesgo, la evaluación de impacto sobre derechos fundamentales es obligatoria.
El generador de E-ARI:
- Recoge los metadatos de su sistema de IA (finalidad, poblaciones afectadas, rol de despliegue)
- Recoge las cláusulas de prueba ya vinculadas a artículos sobre derechos fundamentales
- Genera una evaluación estructurada que cubre: descripción del proceso, periodos, frecuencia, categorías de personas físicas afectadas, riesgos concretos de perjuicio, disposiciones de gobernanza, mecanismos de reclamación
- Muestra las lagunas en el propio texto (p. ej. «No se han encontrado pruebas sobre el diseño de la supervisión humana: requisito del artículo 14»)
- Exporta en PDF y
.docxcon citas de origen incrustadas
Solo puede finalizar una evaluación de impacto cuando todas las secciones requeridas tienen pruebas que las respalden. Las incompletas se guardan como borradores.
6.5 El generador de expedientes técnicos (anexo IV)
El expediente técnico del anexo IV es el documento formal que un organismo notificado o una autoridad de vigilancia pedirá primero.
E-ARI genera la estructura completa que exige el anexo IV:
- Descripción general del sistema de IA
- Descripción detallada (métodos de desarrollo, herramientas de terceros, conjuntos de datos de entrenamiento)
- Información sobre vigilancia, funcionamiento y control
- Documentación del sistema de gestión de riesgos
- Registro de cambios del ciclo de vida
- Métricas de rendimiento, umbrales de exactitud, pruebas de robustez
- Lista de normas armonizadas aplicadas
- Declaración de conformidad (plantilla)
- Plan de vigilancia poscomercialización
Cada sección bebe de su repositorio de pruebas y de su plan de vigilancia. Las secciones sin pruebas que las respalden se marcan con claridad, para que sepa exactamente qué falta.
6.6 El radar de lagunas
Una vista en directo de lo que falta:
- Por obligación: cláusulas requeridas totales frente a cláusulas actualmente probadas
- Ponderado por gravedad (una laguna en la gestión de riesgos del artículo 9 pesa mucho más que una en el registro del artículo 53 para un sistema que no es de uso general)
- Antigüedad: las lagunas abiertas durante más de 30 días suben al principio
- Cada laguna tiene un flujo «Resolver» de un clic que pide el tipo de prueba concreto que se necesita
6.7 El paquete de presentación
Una única exportación .zip, lista para entregar a un organismo notificado, a un auditor o a su propio departamento jurídico:
- Expediente técnico del anexo IV (PDF)
- Evaluación de impacto sobre derechos fundamentales (PDF, si es de alto riesgo)
- Todos los archivos de prueba citados
- Informe de cobertura de obligaciones
- Plan de vigilancia
- Manifiesto con sumas de comprobación SHA-256 como prueba de integridad
6.8 Descubrimiento de IA en la sombra
La mayoría de las organizaciones descubren herramientas de IA cuyo uso desconocían: una exportación de uso de aplicaciones las enumera, pero nada lee esa lista frente a un modelo de riesgo. Discovery cierra esa brecha sin ningún trabajo de integración: exporte su lista de uso de aplicaciones desde Google Workspace, Okta o Microsoft Entra (o una lista de comercios desde su herramienta de gastos), suba el CSV y E-ARI la coteja con un catálogo curado de herramientas de IA, cada entrada anotada con el proveedor, la categoría, si la herramienta se entrena con datos de clientes por defecto y su relevancia para el Reglamento de IA de la UE.
Las herramientas coincidentes aparecen como no declaradas hasta que las registre. Un clic promueve una herramienta descubierta al registro de sistemas de IA (§6.1), creando automáticamente el proveedor en el módulo de riesgo de proveedores; a partir de ahí se aplica la cadena habitual: clasificación de riesgo, obligaciones, pruebas.
6.9 Riesgo de proveedores de IA externos
Todo producto de IA de terceros es el modelo de otro y los términos de datos de otro. El módulo de riesgo de proveedores envía a cada proveedor un cuestionario versionado de unos 10 minutos (tratamiento de datos, seguridad, específicos de IA, jurídicos) mediante un enlace firmado; no necesitan cuenta. La puntuación es determinista: cada respuesta suma puntos, las preguntas sin responder cuentan en el peor caso, y las marcas críticas (sin contrato de encargo, entrenamiento con datos de clientes, sin vía de supresión) fuerzan una calificación crítica sea cual sea la cifra. Los documentos del proveedor (contratos de encargo, informes SOC 2, listas de subencargados) se suben al repositorio de pruebas y pasan por la misma extracción de cláusulas que las pruebas de sistema.
6.10 Cumplimiento del artículo 4 sobre alfabetización en IA
El artículo 4 del Reglamento —en vigor desde el 2 de febrero de 2025— exige que el personal tenga alfabetización en materia de IA suficiente para su puesto. E-ARI incorpora un currículo versionado (fundamentos de la IA, esencial del Reglamento, protección de datos, uso responsable), asignado a los miembros del equipo mediante enlaces mágicos personales que caducan a los 30 días. Las finalizaciones registran la puntuación del cuestionario y un hash de atestación SHA-256 que liga miembro, módulo, marca temporal y versión de contenido. Todo el listado se exporta como informe de prueba listo para una autoridad; a los miembros con retraso se les avisa automáticamente cada semana.
6.11 Controles continuos
La vista de controles responde a la pregunta que un auditor hace de verdad: ¿qué obligaciones está cumpliendo ahora mismo? Cada obligación aplicable a sus sistemas registrados recibe un estado en vivo —cumplida (respaldada por al menos una cláusula de prueba extraída), incumplida (una laguna crítica o alta abierta) o pendiente (aplicable pero aún sin pruebas)— más avisos para las atestaciones que vencen en 30 días. Los estados se derivan del repositorio de pruebas y del radar de lagunas, nunca se autodeclaran. Solo se le envía un resumen semanal si hay algo que hacer.
6.12 API pública
A partir de Growth, acceso de lectura; Enterprise obtiene escritura. Los puntos finales bajo /api/v1/ exponen evaluaciones, el registro de IA, resultados de riesgo de proveedores y estados de control derivados, autenticados con claves revocables de alcance limitado. La referencia está en /developers.
7. Capa 4 — Supervisión continua
El cumplimiento no es un proyecto. Es un proceso que corre indefinidamente.
7.1 Chequeos de pulso
Revisiones mensuales ligeras dirigidas a las preguntas más sensibles a la deriva (gobernanza, seguridad, talento). Llevan de 3 a 5 minutos. Generan un informe de diferencias respecto a su última evaluación completa.
7.2 Registro de cambios normativos y supervisión del cumplimiento
E-ARI no rastrea un canal normativo. Las fechas normativas proceden de una única fuente curada y versionada —el registro de cambios normativos, que publica el texto consolidado del Reglamento con el que trabaja— y cada motor lee sus fechas de esa fuente.
Una tarea programada diaria (/api/cron/compliance-monitoring) revisa sus planes de vigilancia y envía un recordatorio de atestación pendiente cuando la siguiente atestación de un sistema cae dentro de los próximos 30 días: como máximo un correo de recordatorio por sistema y semana, más una notificación en la aplicación. El resumen semanal (§7.4) cubre controles incumplidos, pruebas pendientes y atestaciones vencidas.
7.3 Calendario de atestaciones
El anexo IV exige atestaciones periódicas para los sistemas de alto riesgo. La plataforma sigue:
- Las fechas de reevaluación anual de conformidad
- Las ventanas de actualización de las evaluaciones de impacto de protección de datos (cada 24 meses para sistemas en evolución)
- Los plazos de los informes de vigilancia poscomercialización
- Los ciclos de revisión interna (configurables por sistema)
Cuando un plazo cae dentro de los próximos 30 días, la tarea diaria de cumplimiento envía un recordatorio de atestación pendiente —como máximo uno por sistema y semana— y crea una notificación en la aplicación. Ese es el comportamiento de recordatorio entregado; no existe una cadencia escalonada de 60/30/7/1 días.
7.4 Notificaciones por correo y en la aplicación
Todas las notificaciones se entregan mediante el sistema unificado de plantillas:
- Resumen semanal de cumplimiento (planes de pago: se envía solo si hay algo que hacer)
- Detección de deriva programada con alertas al cambiar: los chequeos de pulso y el motor de supervisión señalan regresiones de puntuación; las alertas se disparan al cambiar, no de forma continua
Baja y gestión de preferencias en /portal/preferences.
8. El recorrido del usuario en cuatro pasos
Cada usuario vive la plataforma como cuatro pasos sucesivos. El cuadro de mando lo hace explícito con una banda de progreso.
Paso 1 — Evaluar
Realice la evaluación sobre 8 pilares. Unos 15 minutos. Produce una referencia que ancla todo el trabajo de cumplimiento posterior.
Paso 2 — Verificar
Registre sus sistemas de IA, suba pruebas, deje que el clasificador se ejecute. La plataforma le dice exactamente qué obligaciones se aplican a cada sistema.
Paso 3 — Cumplir
Genere evaluaciones de impacto y expedientes técnicos. Cierre lagunas. Exporte paquetes de presentación cuando le auditen.
Paso 4 — Supervisar
Lea el registro de cambios normativos. Respete el calendario de atestaciones. Haga chequeos de pulso trimestrales para detectar la deriva a tiempo.
El avance se representa en su portal como una única barra horizontal de pasos —Evaluar → Verificar → Cumplir → Supervisar— con el paso actual destacado y una llamada a la acción contextual que apunta a la siguiente acción concreta.
9. Metodología y puntuación
9.1 Normalización de pilares
Para cada pilar p con preguntas q₁ … q₅ respondidas en una escala de Likert de 1 a 5:
pillar_score(p) = (Σ qᵢ - 5) / 20 × 100
Esto lleva la suma bruta de 5–25 a una escala de 0–100.
9.2 Reglas de interdependencia
Seis reglas documentadas se disparan sobre las puntuaciones normalizadas de los pilares. Cada regla tiene una justificación publicada y queda registrada en el expediente de evaluación, de modo que cualquier ajuste sea reproducible.
| Regla | Desencadenante | Efecto | Por qué |
|---|---|---|---|
| R1 | Gobernanza < 30 | Tecnología × 0,70 | Un utillaje maduro sin gobernanza es riesgo sin controlar, no capacidad. |
| R2 | Datos < 30 | Estrategia × 0,85 | Una estrategia sin base de datos es aspiración, no operación. |
| R3 | Seguridad < 30 | Tecnología × 0,85 | Modelos desplegables sin controles son una responsabilidad. |
| R4 | Talento < 25 | Estrategia × 0,90 | La ambición que excede la capacidad interna no llega a entregarse. |
| R5 | Gobernanza < 35 y Seguridad < 35 | Procesos × 0,85 | La IA industrializada sin controles multiplica los incidentes a escala. |
| R6 | Cultura < 30 | Procesos × 0,92 | Las culturas resistentes al cambio no pueden operacionalizar las ganancias de la IA. |
Las reglas se aplican en el orden declarado. La puntuación original, la ajustada y la regla que se disparó quedan todas guardadas en la evaluación para su repetición en auditoría.
Composición: las reglas se aplican por orden al valor corriente, de modo que cada regla actúa sobre lo que dejó la anterior. Ejemplo resuelto: Gobernanza 25, Seguridad 25, Tecnología 75: R1 da 52,50; luego R3 se aplica a 52,50 y da 44,63. Si R3 hubiera actuado sobre el 75 original en lugar del valor corriente, habría producido 63,75. El registro de auditoría anota la entrada y la salida de cada regla, que es justamente lo que hace repetible la cadena.
9.3 Ponderación sectorial
Las ponderaciones por defecto viven en el motor (15 % Estrategia, 15 % Datos, 12 % Tecnología, 13 % Talento, 15 % Gobernanza, 10 % Cultura, 10 % Procesos, 10 % Seguridad). Tras los ajustes de interdependencia se aplican multiplicadores sectoriales a esas ponderaciones y el resultado se renormaliza para sumar 1,00. Así la puntuación global se mantiene en la escala de 0 a 100 y a la vez refleja lo que de verdad importa en cada sector.
| Sector | Pilares acentuados (×) | Pilares atenuados (×) |
|---|---|---|
| Sanidad | Gobernanza ×1,35 · Seguridad ×1,25 · Datos ×1,20 | Tecnología ×0,90 · Cultura ×0,90 |
| Finanzas | Gobernanza ×1,30 · Seguridad ×1,25 · Datos ×1,20 | Cultura ×0,85 · Talento ×0,90 |
| Industria | Procesos ×1,30 · Datos ×1,20 · Tecnología ×1,15 | Cultura ×0,85 · Talento ×0,90 |
| Distribución | Datos ×1,30 · Procesos ×1,20 · Tecnología ×1,10 | Gobernanza ×0,90 · Talento ×0,95 |
| Tecnología | Tecnología ×1,25 · Talento ×1,20 · Estrategia ×1,10 | Gobernanza ×0,90 · Seguridad ×0,95 |
| Sector público | Gobernanza ×1,35 · Seguridad ×1,25 · Datos ×1,10 | Talento ×0,90 · Cultura ×0,90 |
| Energía | Seguridad ×1,30 · Datos ×1,20 · Procesos ×1,15 | Talento ×0,90 · Cultura ×0,90 |
| Educación | Gobernanza ×1,25 · Cultura ×1,20 · Seguridad ×1,10 | Procesos ×0,95 · Tecnología ×0,95 |
La puntuación global de referencia sin ponderar se conserva junto a la global ponderada por sector, para que los informes puedan mostrar cómo el contexto sectorial movió la cifra, y por qué.
9.4 El motor X-Ray: detección de patrones estructurales
Una puntuación es un número. Un patrón es una historia. Dos organizaciones pueden situarse ambas en el 47 %: una porque es uniformemente mediocre, otra porque tiene una ambición agresiva en IA sin base de datos. Las intervenciones para esas dos no se parecen en nada.
El motor X-Ray ejecuta ocho detectores deterministas sobre el mapa de respuestas y saca a la luz modos de fallo estructurales que emergen de cómo interactúan las preguntas entre pilares. Cada hallazgo lleva su gravedad (baja / media / alta / crítica), las pruebas a nivel de pregunta que lo activaron, el impacto de negocio en términos claros y una única acción concreta recomendada.
| ID | Patrón | Desencadenante | Por qué importa |
|---|---|---|---|
| P-01 | Riesgo de TI en la sombra | Alta adopción tecnológica + suelo de gobernanza bajo | La vía más rápida a un hallazgo de incumplimiento del Reglamento. |
| P-02 | La brecha de ambición | Alta ambición estratégica + base de datos y gobernanza rota | Las iniciativas insignia se atascan en piloto entre los meses 9 y 12. |
| P-03 | El purgatorio de los pilotos | Mucho apetito de experimentación + baja madurez MLOps | Los pilotos se paran en la demostración cuando hay utillaje sin el proceso para operacionalizarlo, y el apetito por el siguiente intento cae con cada uno que se atasca. |
| P-04 | El precipicio de cumplimiento | (governance_5 + governance_3 + security_5 ≤ 6) Y (technology_3 ≥ 4 ∨ process_4 ≥ 4 ∨ technology_3 + process_4 ≥ 2) | El deber de alfabetización del artículo 4 obliga hoy, despliegue lo que despliegue; las obligaciones de alto riesgo de los sistemas autónomos del anexo III se aplican desde el 2 de diciembre de 2027, y levantar una evaluación de impacto más un expediente técnico lleva trimestres. Crítico cuando se está desplegando capacidad real dentro de esa brecha. |
| P-05 | Desajuste talento-estrategia | Alta ambición en IA + poca oferta interna de talento | Las hojas de ruta se retrasan y el gasto externo crece para cubrir el hueco; cada fecha incumplida compra otro externo en vez de la capacidad interna que la habría evitado. |
| P-06 | El punto ciego del sesgo | Alta madurez de despliegue + baja equidad y transparencia | Un incidente de sesgo con esta forma se descubre desde fuera y no desde dentro, porque nada lo vigila: el mismo problema comunicado por un cliente o una autoridad se lee como un fallo de supervisión del artículo 14. |
| P-07 | Desconexión directiva | Fuerte capacidad operativa + escaso respaldo directivo | La capacidad sin respaldo se fragmenta; los ingenieros de IA se van en menos de 18 meses. |
| P-08 | Desajuste de procesos primero | Alta madurez de procesos + capa de datos débil | Equipos disciplinados industrializan los resultados equivocados a gran escala. |
El bloque X-Ray se antepone después a la instrucción de cada agente posterior. El agente Insight debe vincular cada riesgo y cada siguiente paso que produzca a un identificador de hallazgo. El agente de hoja de ruta debe neutralizar cada hallazgo CRÍTICO en la fase 1 y cada hallazgo ALTO en la fase 2. El agente Discovery debe reflejar los hallazgos en sus indicadores de lagunas. Eso es lo que hace que el informe se sienta a medida: los agentes están anclados en su conjunto de patrones concreto, no parafraseando una cifra.
9.5 Intervalo de confianza
Un resultado de puntuación incluye una banda de confianza derivada de:
- Tasa de finalización de preguntas: las evaluaciones parciales obtienen bandas más anchas
- Varianza de las respuestas: extremos altos y bajos en pilares contiguos sugieren fatiga de cuestionario
- Coherencia del texto libre: cuando una explicación contradice la puntuación de Likert, la confianza baja
La banda se muestra en la interfaz como un intervalo (p. ej. «68 ± 4») y se conserva en las exportaciones.
9.6 Comparativas sectoriales
Las comparativas se curan a partir de investigación pública (informes de asociaciones sectoriales, estudios académicos, estadísticas publicadas por reguladores). Están etiquetadas explícitamente en la interfaz:
Las comparativas sectoriales están estimadas por IA y se destinan únicamente a orientación indicativa. El rendimiento real del sector puede variar.
Nunca afirmamos que una comparativa esté al día: citamos el año de los datos subyacentes.
9.7 Por qué no usamos una única «puntuación de confianza»
Algunas plataformas comprimen todo en un único número de 0 a 100 de «fiabilidad». Nosotros no. Un número único oculta la única señal útil: qué dimensión está fallando. Una organización puede ser Referente en estrategia y Rezagada en seguridad a la vez, y eso es accionable. Promediarlo a «Perseguidor, 62» no lo es.
Nuestra metodología, expuesta con honestidad
E-ARI pide a una organización que valore su propia preparación para la IA. La literatura publicada sobre autoevaluación es inequívoca respecto a lo que eso puede y no puede medir, y esta página expone ambas cosas. Cada decisión de diseño de abajo nombra su fuente.
El modelo de tres niveles
- Autodeclarado: el cuestionario tal como se respondió, una medida de percepción, etiquetada como tal.
- Respaldado por pruebas: las respuestas con artefactos en el repositorio, existencia verificada, una cota inferior de la preparación real.
- Verificado de forma independiente: las respuestas verificadas por un auditor o por el motor determinista frente al repositorio de pruebas, funcionamiento verificado. Aún no se ofrece.
Una evaluación completada muestra por tanto tres cifras, no una: la puntuación autodeclarada (etiquetada «Autodeclarada: una medida de percepción»), la puntuación respaldada por pruebas (etiquetada «Respaldada por pruebas: solo respuestas con artefactos en el repositorio») y la cuota de cobertura («el X % de las respuestas está respaldado por pruebas»). Cuando ninguna respuesta lleva prueba, la puntuación respaldada no se muestra en absoluto: una cifra autodeclarada sin nada detrás no es una segunda opinión, es la misma opinión.
Las respuestas sin prueba cuentan a mitad de peso en la puntuación respaldada. El 0,5 es elección nuestra, no una constante de la literatura. Lo que la investigación establece es la dirección: las autovaloraciones son indulgentes en torno a un tercio de desviación típica (d = 0,32; Heidemeier y Moser, 2009), y la aquiescencia empuja al alza las respuestas en escalas de acuerdo (Krosnick, 1999). Ninguna de las dos nos da un número. Dividimos por la mitad lo que nadie puede comprobar, redondeamos a propósito para que no se confunda con una medición, y mostramos al lado la cuota de cobertura para que se vea sobre cuánto de la puntuación actúa siquiera ese peso. Descontar la percepción, no borrarla, es lo que el modelo de niveles afirma.
El diseño con varios evaluadores
Una sola persona respondiendo las 40 preguntas es un diseño de informante único. Conway y Huffcutt (1997) sitúan la fiabilidad entre jueces en ,50 para supervisores, ,37 para pares y ,30 para subordinados, y el acuerdo ENTRE fuentes aún más bajo, ,22 entre uno mismo y su supervisor. Incluso en el mejor caso, la mitad de la varianza queda en el evaluador y no en la organización. El modo de varios evaluadores invita hasta a cuatro responsables funcionales —el director técnico para Tecnología y Datos, el DPD para Gobernanza y Seguridad, el director de operaciones para Procesos y Cultura, el director de personas para Talento y Estrategia— a responder solo los pilares que cubre su puesto. La puntuación de consenso es la respuesta mediana por pregunta entre evaluadores, puntuada por el mismo motor determinista. Las evaluaciones con un solo evaluador se marcan como tales, con esa salvedad adjunta.
La divergencia entre evaluadores es una señal, no un error: indica dónde los responsables funcionales tienen visiones distintas de la preparación de la organización.
No lo sé, no aplicable y el papel de quien responde
Una escala de acuerdo de elección forzada solo ofrece malas opciones a quien realmente no lo sabe. Los honestos eligen «Totalmente en desacuerdo», y el instrumento registra un hallazgo que esa persona nunca formuló: un déficit de gobernanza que en realidad es una laguna de conocimiento. Los experimentos de Schuman y Presser (1981) con filtros de «sin opinión» son el resultado clásico —los formularios de elección forzada recogen seudoopiniones de gente que no las tiene—, citados aquí solo para la dirección: esa fuente NO ESTÁ VERIFICADA DE FORMA INDEPENDIENTE, y no se usa ninguna cifra de ella. La evaluación registra por tanto dos anotaciones que una respuesta puede llevar en lugar de una valoración —No lo sé y No aplicable— y ambas quedan excluidas de la aritmética de puntuación: el pilar renormaliza sobre sus preguntas respondidas, de modo que un desconocido nunca baja una puntuación ni la infla. En su lugar se muestran como lagunas de cobertura: por pilar, «x de 5 respondidas», nombrando las preguntas sin respuesta. Un pilar cuyas preguntas están todas anotadas se rechaza sin más (E_NO_PILLAR_COVERAGE): una puntuación calculada a partir de ninguna medición no es una puntuación. La renormalización está acotada por la misma razón —toma prestadas las preguntas respondidas para que hagan de las que faltan—, así que un pilar con menos de tres de sus cinco preguntas valoradas también se rechaza (E_INSUFFICIENT_PILLAR_COVERAGE) en lugar de dejar que dos respuestas hagan de pilar. Sin acotar, la aritmética alcanzaba su límite con una respuesta valorada por pilar: ocho de cuarenta, todas en lo alto de la escala, producían un compuesto de 99,99 que se veía exactamente igual que uno calculado sobre el instrumento entero. Los detectores X-Ray no se disparan sobre una pregunta anotada, por la misma razón que los rechazos —su desencadenante no puede evaluarse sobre datos que no existen—, y un detector que no pudo evaluarse se informa como tal, nunca como uno que se ejecutó y no encontró nada. Esto es un cambio de puntuación, no un añadido de interfaz: una evaluación que usa las anotaciones puntúa distinto que una en la que esas mismas preguntas se responden con 1. Las anotaciones llegaron como SCORING_VERSION 5.5 y el acotado de la renormalización como SCORING_VERSION 5.6, cada uno con vectores de conformidad rederivados; el acotado no mueve ninguna puntuación, y las evaluaciones puntuadas sin anotaciones siguen siendo idénticas bit a bit a la 5.4.
«Evaluador único» es la versión tosca de una pregunta más afilada: ¿qué evaluador? Un director técnico que responde las 40 preguntas habla de primera mano de Tecnología y Datos y de segunda mano de Gobernanza y Cultura, y el coste en fiabilidad no se reparte por igual (Conway y Huffcutt, 1997; la práctica 360° de emparejar evaluadores con dominios es Bracken, Timmreck y Church, 2001). Cada evaluación registra por tanto el papel funcional de quien responde, y los resultados nombran qué pilares cubre ese papel de primera mano; los de segunda mano se etiquetan como tales, para que un lector vea dónde la percepción es más delgada. El papel también siembra las invitaciones a otros evaluadores: los papeles que quien responde no ocupa son los que vale la pena invitar.
El segundo instrumento: los constructos normativos
La auditoría de rediseño también preguntó qué terreno normativo no cubren en absoluto las 40 preguntas, y encontró nueve constructos: un inventario de sistemas de IA con las clasificaciones del art. 6 registradas, las obligaciones de cadena de suministro para proveedores y modelos de uso general, la gestión de incidentes, el registro, los detalles de la supervisión humana, la vigilancia poscomercialización, la profundidad de las métricas de sesgo, y los bucles de auditoría interna (9.2) y revisión por la dirección (9.3) de ISO/IEC 42001. No se añaden deliberadamente al instrumento puntuado: las 40 preguntas son metodología congelada (SCORING_VERSION 5.6), y añadir preguntas reescribiría todas las evaluaciones jamás realizadas. Forman en cambio un segundo instrumento: una lista de comprobación diagnóstica respondida con sí / no / parcialmente / no lo sé / no aplicable, donde no y parcialmente son lagunas abiertas, no lo sé es una laguna de conocimiento, y no aplicable se registra y se excluye. Se informa como diagnóstico y lagunas, nunca como puntuación. Qué obligaciones se aplican lo decide el motor de cumplimiento; los ítems enlazan con sus códigos de obligación para mostrar sobre qué deber presiona una laguna, nada más.
Verificación anclada en el comportamiento
Cuando una pregunta tiene forma comprobable de hecho («¿Su plan de respuesta a incidentes aborda específicamente los fallos de sistemas de IA?» en lugar de «¿Qué madurez tiene su respuesta a incidentes?»), la evaluación ofrece ambas: el ítem de Likert original, que sigue siendo la respuesta puntuada por compatibilidad, y un control «Verificar esta respuesta» con Sí/No/Parcialmente. Un Sí verificado cuenta a peso completo en la puntuación respaldada por pruebas; la respuesta de Likert no cambia. Este es el patrón BARS: preguntar si algo concreto y observable es cierto en vez de qué tal se percibe. Latham, Wexley y Pursell (1975) y Schwarz (1999) sostienen el mecanismo: el formato fija el marco de referencia, y una pregunta comprobable es más difícil de inflar que una global. Ninguno de los dos informa de una reducción porcentual, y el «~40 %» que este documento afirmaba antes no estaba en ninguno.
La investigación sobre sesgos en la que se apoya
- Podsakoff, MacKenzie y Podsakoff (2012). «Sources of Method Bias in Social Science Research and Recommendations on How to Control It.» Annual Review of Psychology 63, 539–569. — La varianza de método común —una misma persona respondiendo por ambos lados— infla las relaciones observadas en constructos subjetivos. La revisión establece la dirección y cómo diseñar contra ella; no da un porcentaje único, y el «25–40 %» que figuraba aquí antes carecía de fuente.
- Kruger y Dunning (1999). «Unskilled and Unaware of It.» Journal of Personality and Social Psychology 77(6), 1121–1134. — Quienes rendían en el cuartil inferior puntuaban en el percentil 12 y se situaban a sí mismos en el 62: 50 puntos, en palabras del propio artículo. Las organizaciones peor equipadas para gobernar la IA son las más propensas a valorarse alto, porque no pueden ver qué aspecto tiene la madurez.
- Heidemeier y Moser (2009). «Self–Other Agreement in Job Performance Ratings: A Meta-Analytic Test of a Process Model.» Journal of Applied Psychology 94(2), 353–370. — En 128 muestras, el acuerdo entre uno mismo y su supervisor es r = ,22 y las autovaloraciones son indulgentes en d = 0,32 (Δ = ,49 corregido): en torno a un tercio de desviación típica, no la mitad que se indicaba aquí antes.
- Latham, Wexley y Pursell (1975). «Training Managers to Minimize Rating Errors in the Observation of Behavior.» Journal of Applied Psychology 60(5), 550–555. — Los evaluadores a quienes se pregunta por conductas observables concretas yerran menos que aquellos a quienes se pide un juicio global. Es un estudio sobre formación de evaluadores, no una comparación de BARS frente a Likert, y no informa de ningún porcentaje: el «~40 %» que se indicaba aquí no estaba en él.
- Schwarz (1999). «Self-Reports: How the Questions Shape the Answers.» American Psychologist 54(2), 93–105. — El formato de la pregunta fija el marco de referencia: «¿Qué madurez tiene su respuesta a incidentes?» invita a un juicio global; «¿Su plan de respuesta a incidentes aborda los fallos de sistemas de IA?» invoca un hecho comprobable.
- Krosnick (1999). «Survey Research.» Annual Review of Psychology 50. — La aquiescencia —estar de acuerdo con independencia del contenido— es una amenaza conocida para los ítems en escala de acuerdo, y se reduce cuando las preguntas piden hechos en lugar de adhesión. Aquí no se atribuye ningún porcentaje: el «~10–15 %» anterior carecía de fuente, y una cifra de ese tamaño no justificaría en ningún caso partir una respuesta por la mitad. El descuento de 0,5 es nuestra propia elección conservadora, descrita más abajo.
- Conway y Huffcutt (1997). «Psychometric Properties of Multisource Performance Ratings: A Meta-Analysis of Subordinate, Supervisor, Peer, and Self-Ratings.» Human Performance 10(4), 331–360. — La fiabilidad difiere según la fuente: supervisores ,50, pares ,37, subordinados ,30; el ,50 es el mejor caso, no la media. El acuerdo entre fuentes es aún menor (uno mismo frente al supervisor, ,22). Cualquier evaluador único deja la mayor parte de la varianza ligada al evaluador, y por eso existen el modo de varios evaluadores y la marca de evaluador único. La ganancia de promediar evaluadores es Spearman-Brown, proyección nuestra y no un hallazgo de este artículo.
- Van der Heijden y Nijhof (2004). «The value of subjectivity: problems and prospects for 360-degree appraisal systems.» International Journal of Human Resource Management 15(3), 493–511. — La divergencia entre evaluadores de distintas funciones es en sí misma una señal diagnóstica válida: la base para informar de la divergencia en lugar de promediarla.
- Bracken, Timmreck y Church (2001). The Handbook of Multisource Feedback. Jossey-Bass. — La práctica 360° establecida: los evaluadores responden conjuntos de preguntas emparejados con su dominio de experiencia, y el desacuerdo se informa como hallazgo.
- Oxford Insights (2024). Government AI Readiness Index Methodology. — Recurre a fuentes de datos verificables externamente siempre que puede y presenta los datos de encuesta como «basados en percepción»: el patrón de honestidad que siguen nuestras etiquetas de nivel.
- Cisco (2024). AI Readiness Index Methodology. — Lo dice sin rodeos: «This is a perception study reflecting business leaders' views», una autoevaluación etiquetada como percepción y no como preparación objetiva.
Qué podemos afirmar
- «La puntuación autodeclarada es una medida de percepción, y la etiquetamos como tal»
- «La puntuación respaldada por pruebas solo cuenta las respuestas con artefactos en el repositorio: es una cota inferior de la preparación real»
- «La cuota de cobertura le dice qué parte de la autoevaluación está respaldada por pruebas verificables»
- «El modo de varios evaluadores saca a la luz el desacuerdo entre responsables funcionales como señal diagnóstica»
- «Las respuestas No lo sé y No aplicable se excluyen de la puntuación y se informan como lagunas de cobertura, nunca se convierten en la peor respuesta»
- «Cada evaluación registra el papel funcional de quien responde, y los resultados nombran de qué pilares habla ese papel de primera mano y de cuáles no»
- «El instrumento de constructos cubre nueve áreas normativas que el instrumento puntuado no cubre, informadas como diagnóstico y lagunas, nunca como puntuación»
Qué seguimos sin poder afirmar
- «Una puntuación E-ARI más alta predice el éxito de los proyectos de IA: no hay datos de resultado»
- «El instrumento está validado de forma independiente: no hay estudio de validación publicado (requiere más de 50 organizaciones y 12 meses)»
- «La puntuación respaldada por pruebas equivale a cumplimiento auditado: verifica existencia, no eficacia operativa»
El estudio de validación
La recogida de datos para un estudio de validación ya ha empezado. Las organizaciones que han dado su consentimiento reciben una instantánea mensual de sus puntuaciones —autodeclarada, respaldada por pruebas, cuota de cobertura, mapa de pilares, versión de puntuación— y el lado de resultados se registra junto a ella: eventos autodeclarados de proyecto, incidente y auditoría, más el propio registro de acierto de la cuenta atrás de cumplimiento, unidos a las puntuaciones solo en el momento del análisis. La retirada elimina las instantáneas y los resultados de una organización. Nada de esto cambia una afirmación: no existe ninguna cifra de validez, y la lista «qué seguimos sin poder afirmar» de arriba permanece intacta hasta que se publique un estudio sobre estos datos. La disposición del estudio se publica como un contador —organizaciones y meses— dondequiera que se divulgue esta metodología, para que la distancia que queda por recorrer se enuncie en lugar de insinuarse.
Estos límites son portantes. Cuando el instrumento tenga datos de resultado, un estudio de validación publicado o el visto bueno de un auditor detrás de un nivel, la línea correspondiente pasará de «no podemos» a «podemos», y no antes.
10. Privacidad, seguridad y tratamiento de datos
10.1 Qué almacenamos
| Categoría | Ejemplos | Dónde |
|---|---|---|
| Datos de cuenta | Nombre, correo, organización, rol, hash de contraseña | PostgreSQL (Supabase) |
| Respuestas de evaluación | Respuestas de Likert, aclaraciones en texto libre | PostgreSQL |
| Metadatos de sistemas de IA | Nombre del sistema, finalidad, sector, clasificación | PostgreSQL |
| Documentos de prueba | Archivos subidos (evaluaciones de impacto, contratos, fichas de modelo) | Vercel Blob (privado) |
| Artefactos generados | Evaluaciones de impacto, expedientes técnicos, informes | PostgreSQL + Vercel Blob |
| Registros | Registro de auditoría de cumplimiento, acciones de usuario | PostgreSQL, conservación 90 días |
| Pago | Identificador de cliente, plan de suscripción | Stripe (nunca almacenamos números de tarjeta) |
10.2 Cifrado
- En tránsito: TLS 1.3 en todas partes, incluido en la lista de precarga HSTS
- En reposo: AES-256 (aportado por Supabase y Vercel Blob)
- Contraseñas: bcrypt con factor de coste 12
10.3 Autenticación
- Correo y contraseña (proveedor de credenciales de NextAuth)
- Google OAuth (proveedor de Google de NextAuth)
- SSO (OIDC) en el plan Enterprise, configurado con su proveedor de identidad (Okta, Entra ID, Google Workspace, Keycloak). El SSO todavía no puede imponerse; el inicio de sesión con contraseña sigue disponible.
Las sesiones usan JWT con cookies HttpOnly, Secure y SameSite=Lax.
10.4 Localización de los datos
El cómputo está fijado a una región de la UE (Vercel, Fráncfort). La base de datos funciona en Supabase (AWS) y hoy se encuentra en la región us-east-1 de AWS; la migración a una región de la UE está en la hoja de ruta. Hoy no afirmamos localización de datos en la UE; las garantías para las transferencias transfronterizas se describen en el contrato de encargo del tratamiento.
10.5 Supresión de datos
- La eliminación de la cuenta es autoservicio desde
/portal/preferences - La supresión es definitiva (no lógica): en 30 días se purgan todos los datos de la cuenta, incluidos archivos de prueba, evaluaciones, evaluaciones de impacto y registros
- La conservación del registro de auditoría es independiente y se purga a los 90 días con independencia del estado de la cuenta
10.6 Postura ante el RGPD
- Contrato de encargo disponible a petición (
hello@e-ari.com) - Lista de subencargados mantenida en
/privacy#sub-processors - Derecho de supresión atendido en 30 días
- Derecho a la portabilidad: exportación completa de la cuenta en JSON desde
/portal/preferences
10.7 Uso de modelos de lenguaje de terceros
Usamos varios proveedores de modelos de lenguaje (Gemini, GLM, modelos alojados por NVIDIA). Todos los proveedores están configurados con retención de datos nula para nuestra clave de API. No usamos datos de clientes para entrenar ningún modelo. Las entradas de texto libre se depuran de patrones habituales de datos personales antes de enviarse a cualquier punto final de modelo de lenguaje.
11. Planes y precios
| Plan | Precio | Ideal para |
|---|---|---|
| Starter | Gratuito | Profesionales independientes que exploran la plataforma |
| Professional | 199 €/mes o 1.990 €/año (17 % de ahorro) | Profesionales que realizan evaluaciones periódicas |
| Growth | 499 €/mes o 4.990 €/año (17 % de ahorro) | Organizaciones en crecimiento con varios sistemas de IA |
| Enterprise | A medida | Sectores regulados, despliegues multiorganización |
11.1 Qué incluye cada plan
| Capacidad | Starter | Professional | Growth | Enterprise |
|---|---|---|---|---|
| Evaluaciones completas al mes | 1 | 5 | 20 | Ilimitadas |
| Chequeos de pulso al mes | 3 | 15 | 50 | Ilimitados |
| Miembros del equipo | 1 | 5 | 25 | Ilimitados |
Informes .docx | 1/mes (exportaciones extra a petición) | 3 incluidos | Ilimitados | Ilimitados + marca propia |
| Hub Literacy | Básico | Biblioteca completa | Completa + rutas de aprendizaje | Completa + contenidos propios |
| Comparativas sectoriales | 1 sector | 5 sectores | Todos los sectores | Todos + comparativas propias |
| Autopiloto de cumplimiento | — | — | ✓ | ✓ |
| Evaluación de impacto + expediente técnico | — | — | ✓ | ✓ |
| Portal de administración | — | Básico | Completo | Completo + SSO (OIDC) |
| Acceso a la API | — | — | Solo lectura | CRUD completo |
| Soporte | Comunidad | Correo (48 h) | Chat + revisión trimestral | Responsable dedicado + SLA |
11.2 Cancelación
Cancele cuando quiera. El acceso se mantiene hasta el final del periodo de facturación. La cuenta vuelve automáticamente a Starter: sus datos se conservan, simplemente pierde el acceso a las funciones de pago.
12. A quién va dirigido
12.1 Tres perfiles principales
El responsable de programa de IA en una empresa mediana (entre 500 y 5.000 empleados). Reporta al director de operaciones o de sistemas. Es dueño de la hoja de ruta de la estrategia de IA. Necesita E-ARI para:
- demostrar avances a la dirección trimestre a trimestre
- traducir las lagunas de preparación en propuestas de inversión concretas
- mostrar al consejo que la empresa no va por detrás de sus homólogas
El DPD o responsable de cumplimiento en cualquier organización que despliegue IA en jurisdicciones de la UE. Necesita E-ARI para:
- clasificar automáticamente los sistemas de IA frente al Reglamento
- mantener un repositorio de pruebas vivo que sobreviva a una auditoría
- generar evaluaciones de impacto y expedientes técnicos sin contratar a un gran despacho
El auditor interno que prepara una auditoría externa, una certificación ISO 42001 o la evaluación de un organismo notificado. Necesita E-ARI para:
- producir un único paquete de presentación con sumas de comprobación
- mostrar tendencias de cobertura en el tiempo (ritmo de cierre de lagunas)
- aportar registros a prueba de manipulación de cualquier cambio en un artefacto
12.2 A quién no va dirigido
Sobre esto somos explícitos. E-ARI no es la herramienta adecuada si necesita:
- un registro de modelos (use MLflow, Weights & Biases o una plataforma MLOps)
- una herramienta GRC generalista que cubra SOC 2, ISO 27001, HIPAA (use Vanta, Drata, Secureframe)
- asesoramiento jurídico (E-ARI saca a la luz obligaciones; no sustituye a un abogado)
- gestión de proyectos de entrega de IA (use Linear, Jira, Asana)
Cuanto más ceñido el alcance, mejor la herramienta.
13. Hoja de ruta
Focos actuales (sujetos a cambio):
| Trimestre | Tema | Aspectos destacados |
|---|---|---|
| T2 2026 | Ecosistema de conectores | Slack, Microsoft Teams, importación de pruebas desde Confluence, sincronización con Google Drive |
| T3 2026 | Alineación con ISO 42001 | Correspondencia entre obligaciones del Reglamento y controles de ISO 42001 |
| T4 2026 | Multijurisdicción | Marco regulatorio británico de IA, orden ejecutiva de EE. UU., cumplimiento AEDT de Nueva York |
| T1 2027 | Flujos con organismos notificados | Plantillas de evaluación previa de conformidad, paquetes automatizados de enlace con el organismo |
La hoja de ruta se publica en la plataforma y se actualiza cada mes.
14. Glosario
Reglamento de IA — Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo por el que se establecen normas armonizadas en materia de inteligencia artificial. En vigor desde el 1 de agosto de 2024.
Anexo III — La lista de casos de uso de IA de alto riesgo enumerados en el anexo III del Reglamento (biometría, educación, empleo, servicios esenciales, aplicación de la ley, migración, justicia).
Anexo IV — La estructura del expediente técnico exigido para los sistemas de IA de alto riesgo.
Artículo 5 — Prohíbe determinadas prácticas de IA: manipulación subliminal, explotación de vulnerabilidades, puntuación social, identificación biométrica remota en tiempo real en espacios públicos.
Artículo 27 — Exige una evaluación de impacto sobre derechos fundamentales para los sistemas de IA de alto riesgo utilizados por autoridades públicas u operadores de servicios esenciales.
Artículos 50 a 53 — Obligaciones de transparencia para sistemas de riesgo limitado (chatbots, ultrafalsificaciones, categorización biométrica, reconocimiento de emociones).
Evaluación de la conformidad — El procedimiento por el que un sistema de IA de alto riesgo demuestra que cumple los requisitos del Reglamento antes de introducirse en el mercado de la UE.
Responsable del despliegue — Toda persona física o jurídica, autoridad pública u organismo que utilice un sistema de IA bajo su autoridad. Distinto del proveedor (la entidad que desarrolla el sistema o hace que se desarrolle).
EIPD — Evaluación de impacto relativa a la protección de datos, del artículo 35 del RGPD. A menudo requisito previo de la evaluación de impacto sobre derechos fundamentales.
EIDF — Evaluación de impacto sobre derechos fundamentales, del artículo 27 del Reglamento de IA.
Modelo de IA de uso general — Modelo fundacional. Sujeto a un régimen de obligaciones propio en los artículos 51 a 55.
Organismo notificado — Organismo designado por un Estado miembro de la UE para evaluar la conformidad de ciertos sistemas de IA de alto riesgo antes de su introducción en el mercado.
Pilar — Una de las ocho dimensiones de preparación de E-ARI (Estrategia, Datos, Tecnología, Talento, Gobernanza, Cultura, Procesos, Seguridad).
Chequeo de pulso — Una evaluación mensual breve, dirigida a las preguntas sensibles a la deriva.
Paquete de presentación — La exportación .zip única que reúne expediente técnico del anexo IV, evaluación de impacto, pruebas y manifiesto, lista para un organismo notificado o un auditor.
Expediente técnico — El dosier exigido por el anexo IV para los sistemas de IA de alto riesgo. Debe mantenerse actualizado durante toda la vida del sistema.
Anexo A — URL principales
| Superficie | URL |
|---|---|
| Sitio de marketing | https://www.e-ari.com |
| Precios | https://www.e-ari.com/pricing |
| Iniciar sesión | https://www.e-ari.com/auth/login |
| Portal | https://www.e-ari.com/portal |
| Casos de uso (cumplimiento) | https://www.e-ari.com/portal/use-cases |
| Repositorio de pruebas | https://www.e-ari.com/portal/evidence |
| Política de privacidad | https://www.e-ari.com/privacy |
| Condiciones del servicio | https://www.e-ari.com/terms |
| Estado y salud | https://www.e-ari.com/api/health |
Anexo B — Contacto
| Tema | Correo |
|---|---|
| Preguntas generales | hello@e-ari.com |
| Ventas / Enterprise | sales@e-ari.com |
| Privacidad / DPD | privacy@e-ari.com |
| Divulgación de seguridad | security@e-ari.com |
| Soporte | support@e-ari.com |
E-ARI está operado por el equipo de E-ARI. El cómputo de la aplicación está fijado a la UE (Vercel, Fráncfort); la base de datos funciona en Supabase (AWS, hoy us-east-1), con una migración a una región de la UE en la hoja de ruta. Este documento es fidedigno a la fecha de versión indicada arriba; la versión más reciente se sirve siempre en https://www.e-ari.com/docs/e-ari-handbook.md.