DCC Doctoral

Simulador de Jailbreak Clínico y Seguridad IA

Laboratorio de pruebas de penetración y alineación ética para agentes de salud local

Módulo de Ciberseguridad IA

¿Qué es el Jailbreak de IA en Sistemas Médicos?

El jailbreak de IA ocurre cuando los hackers y usuarios maliciosos explotan vulnerabilidades en los sistemas de IA para eludir sus pautas éticas y realizar acciones restringidas. Utilizan técnicas comunes de jailbreak de IA, como ataques de inyección de instrucciones y escenarios de juego de roles.

En el contexto del seguimiento farmacoterapéutico, un jailbreak exitoso podría forzar al agente virtual (como Dra. Gemma) a prescribir dosis nocivas de medicamentos, ignorar alergias críticas del paciente o revelar datos clínicos privados y desprotegidos. Por ello, la tesis del doctorando Luis Ramón Tercero incorpora un filtro y restricciones acopladas a la topología del hipergrafo DHCAN para bloquear estas transgresiones éticas en el dispositivo local.

Templates de Ataque (Inyección)

Seleccione un vector de ataque prediseñado para auditar la robustez del agente:

Terminal de Auditoría y Detección en Local

Consola inactiva. Seleccione un template y ejecute el test para visualizar el análisis ético de tokens.

Mejores Prácticas de Mitigación y Defensas en Salud

A continuación se detallan las estrategias críticas que se implementan en la arquitectura de la tesis para contrarrestar ataques de Jailbreak y salvaguardar la integridad farmacoterapéutica:

01

Filtro de Tokens Clínicos

Implementación de una lista negra y blanca de tokens a nivel de decodificador local. Si la instrucción del prompt del paciente incluye verbos imperativos coercitivos o solicita manipulación de dosis críticas, se interrumpe la generación de logits antes de renderizarse.

02

Gating por Hipergrafo DHCAN

Toda recomendación terapéutica del Agente Virtual de Gemma 4 es contrastada con los nodos del hipergrafo activo del paciente. Si la sugerencia química no coincide con la prescripción formal u historial del paciente cargado, el validador estructural anula el output.

03

Alineamiento RLHF Médico

Entrenamiento por Refuerzo con Retroalimentación Humana (RLHF) especializado para médicos y QFBs locales. Esto enseña al LLM a priorizar el código deontológico sanitario sobre cualquier solicitud directa del paciente por más coherente que parezca.