Cuaderno de gobernanza
Auditar un validador de IA: qué revisar antes de confiar en su puntuación
Trazabilidad del modelo, sesgo en los datos de entrenamiento y mecanismos de apelación para participantes sancionados
Cuando un clasificador decide quién puede operar en un pool cerrado, ya no estamos ante una herramienta de filtrado: estamos ante un órgano de gobierno. Esa puntuación que degrada permisos, retrasa órdenes o expulsa una wallet tiene consecuencias económicas concretas para el participante afectado y para el propio pool. Por eso la pregunta útil no es si el modelo funciona, sino qué evidencia tenemos para confiar en él cuando se equivoca.
La lista de comprobación que usamos en revisiones internas se organiza en cuatro frentes. Ninguno es suficiente por separado, y en la práctica el más descuidado suele ser el último: el canal de apelación.
Procedencia y licencia de los datos de entrenamiento
Antes de mirar métricas conviene responder de dónde salieron los datos. Un validador entrenado con flujos de un solo venue hereda los sesgos de ese venue: horarios, tipos de par, tamaño típico de orden. Si el pool donde se va a desplegar opera con otra estructura de comisiones o con participantes de otra región, la distribución cambia y el modelo puntúa fuera de su dominio. También importa la licencia: datos agregados de terceros con cláusulas de uso restringido pueden impedir que el equipo de riesgo reproduzca un caso concreto cuando alguien reclama.
Documentación de la versión del modelo en cada decisión
Cada bloqueo o degradación debería quedar asociado a un identificador de versión, a la fecha de entrenamiento y al conjunto de características activas en ese momento. Sin esa trazabilidad, reconstruir por qué una wallet fue marcada tres meses atrás se vuelve arqueología. En nuestros despliegues guardamos el vector de entrada anonimizado junto al identificador de modelo, de modo que una revisión posterior pueda repetir la inferencia y comparar resultados.
Equidad entre wallets de distinto tamaño
Un patrón tóxico ejecutado por una mesa grande y otro ejecutado por una wallet pequeña deberían recibir puntuaciones comparables. Cuando el modelo aprende de datos donde el volumen alto es sinónimo de legitimidad, tiende a castigar desproporcionadamente a participantes pequeños con estrategias legítimas pero irregulares. Medimos esta brecha separando las tasas de falsos positivos por tramos de tamaño y revisando si la diferencia se mantiene estable entre regímenes de volatilidad.
Apelación con plazos definidos
Un participante sancionado necesita saber qué se le imputa, con qué evidencia y en cuánto tiempo obtendrá respuesta. Un canal de apelación sin plazos escritos equivale a no tenerlo. En la práctica esto implica un formulario con campos obligatorios, un responsable asignado por caso y un registro público interno de resoluciones que permita detectar patrones de rechazo sistemático.
El modelo también envejece
Un clasificador entrenado durante un régimen de mercado concreto pierde precisión cuando cambia la estructura de comisiones, aparece un nuevo tipo de ataque o se modifica el perfil de los participantes. No hay forma de evitarlo del todo; lo que sí se puede hacer es programar revisiones trimestrales y pruebas con datos sintéticos adversariales que simulen comportamientos aún no observados. Si el equipo no tiene capacidad para ejecutar esas pruebas, conviene reconocerlo antes de prometer una puntuación estable.
Auditar un validador no es un ejercicio de desconfianza hacia la IA. Es la condición para que su puntuación signifique algo dentro del pool. Un modelo sin trazabilidad, sin métricas de equidad y sin apelación no gobierna: solo decide.