Métricas de formación en ciberseguridad: mide más que la finalización

Mide la formación en ciberseguridad con definiciones claras de participación, decisiones, retención y avisos. Compara resultados con criterios y límites explícitos.

Equipo editorial de CyberPlay · Publicado el · Actualizado el · 11 min de lectura

Guía y ejercicios en español

Escena del juego Ghost Protocol.

Ampliar imagen

Imagen de la galería de CyberPlay de Ghost Protocol. Escena ilustrativa; el texto de la interfaz mostrada está en inglés.

Las métricas de formación en ciberseguridad útiles responden a una pregunta específica. La finalización indica si se completó una actividad asignada. Una puntuación puede describir el rendimiento dentro de esa actividad. Un escenario posterior permite examinar si el alumno puede aplicar un principio tras el paso del tiempo. La notificación de incidentes en el entorno laboral describe otra parte del sistema. Combinar estas mediciones en un único porcentaje tranquilizador oculta las diferencias que las hacen útiles.

Comience con una decisión que el programa pretenda respaldar, defina la evidencia que razonablemente pueda recopilar y decida qué desencadenaría una mejora. Esta guía proporciona un diccionario de métricas y un diseño de evaluación ilustrativo. No contiene cifras de resultados de clientes. Sus ejemplos muestran cómo razonar sobre las mediciones sin tratar el progreso en un juego, las notas de un cuestionario o los desenlaces de un phishing simulado como prueba de que se han prevenido incidentes.

Lo que te llevas

  • Defina cada numerador, denominador, ventana temporal y exclusión.
  • Separe participación, rendimiento en la actividad, retención y conducta laboral.
  • Compare escenarios de dificultad similar y describa las diferencias.
  • Use los datos para optimizar procesos; evite atribuir reducciones de brechas no probadas.

1. Comience con la decisión y la pregunta de evaluación

Suponga que el comportamiento deseado consiste en verificar un cambio inusual en los datos de pago a través de un contacto de confianza ya existente. La pregunta de evaluación podría ser: ¿pueden los participantes de finanzas seleccionar esa vía en un escenario modificado tras la sesión? A partir de ahí, puede diseñar el planteamiento, registrar la primera decisión y comparar el razonamiento con una guía de puntuación sencilla. Esto aporta mucha más información que limitarse a preguntar si la sesión resultó popular.

La publicación NIST SP 800-50 Rev. 1 incluye la evaluación y las métricas dentro de un programa de aprendizaje en mantenimiento continuo. Utilice los resultados para decidir qué modificar: una instrucción poco clara, una actividad inaccesible o un directorio de contactos ausente. Una métrica que carezca de consecuencias plausibles para las decisiones del programa puede resultar innecesaria de recopilar.

Mecánica de Phishing Detective 3D: revisando la factura de un proveedor.

Ampliar imagen · Captura del juego · Interfaz en inglés

  1. Compare los datos modificados

    Compruebe qué datos de pago cambiaron y si la solicitud coincide con la factura y el trabajo previstos.

  2. Compare con una factura fiable

    Compare con una factura fiable y verifique los cambios bancarios mediante el contacto del proveedor registrado previamente.

Mecánica de Phishing Detective 3D: revisando la factura de un proveedor.

Fuentes de esta sección: Diseño de un programa de aprendizaje sobre ciberseguridad y privacidad, SP 800-50 Rev. 1

2. Utilice un diccionario de métricas antes de crear un cuadro de mando

Las definiciones que figuran a continuación son ejemplos para un plan de evaluación local. Especifique si la unidad de medida es una persona, una asignación, una sesión o un mensaje. Un alumno puede iniciar varias sesiones de juego para una misma asignación, por lo que el recuento de sesiones y el de empleados no pueden sustituirse entre sí. Documente la ventana temporal y las reglas de elegibilidad junto a la cifra.

2. Utilice un diccionario de métricas antes de crear un cuadro de mando
MétricaDefinición de ejemploQué puede respaldar
FinalizaciónPersonas asignadas elegibles que completaron la actividad antes de la fecha límite / personas asignadas elegiblesSi la actividad planificada llegó al grupo previsto.
Precisión en la primera decisiónParticipantes que seleccionan la acción definida como adecuada en su primer intento / participantes con un primer intento válidoRendimiento ante la decisión presentada.
Calidad del razonamientoRespuestas que cumplen con una rúbrica de explicación definida / respuestas evaluadasSi los participantes pueden explicar un paso de verificación o de notificación de incidentes.
Aplicación diferidaParticipantes que toman la decisión adecuada en un escenario modificado posterior / participantes con un seguimiento válidoAplicación práctica bajo las condiciones de ese seguimiento.
Notificación en simulacionesDestinatarios con una notificación válida / destinatarios con entrega confirmada, según las reglas establecidasComportamiento de notificación durante esa simulación específica.
Tiempo hasta la primera notificación útilTiempo transcurrido desde el inicio definido de la campaña hasta la primera notificación que cumpla los criterios establecidosUna perspectiva a nivel de ejercicio sobre la rapidez con la que se recibió información procesable.
Cierre de mejorasAcciones acordadas de programa o proceso completadas antes de la fecha prevista / acciones pendientes con vencimientoSi se abordaron las barreras identificadas.

3. Interprete la finalización antes de interpretar el aprendizaje

Una tasa de finalización baja puede deberse a convocatorias poco claras, turnos de trabajo, controles inaccesibles, permisos o falta de dispositivos adecuados. Conviene separar estas causas de la situación en la que alguien inicia una actividad y decide no terminarla. Registre una regla de elegibilidad antes del periodo de informe para que las exclusiones no se alteren de forma encubierta con el fin de maquillar un resultado. Muestre el recuento numérico junto al porcentaje, en particular en equipos pequeños.

Por ejemplo, una asignación dirigida a veinte personas puede incluir a dos con una baja prolongada. Decida si permanecen en el denominador actual o si se les asigna una fecha límite posterior, y justifique esta elección de forma coherente. No compare el porcentaje resultante con el de otro equipo cuyas normas relativas a ausencias sean diferentes. El dato solo puede interpretarse con rigor una vez que el contexto operativo se hace visible.

4. Distinga los primeros intentos de la práctica guiada

Un alumno que recibe pistas y reintenta la tarea hasta lograrlo ha completado una práctica útil, pero el resultado final no equivale a una primera decisión independiente. Mantenga separados ambos estados siempre que la actividad lo permita. Si no es así, describa el resultado disponible con honestidad en lugar de reconstruir una métrica artificial de primer intento sin respaldo.

Redacte una pequeña rúbrica para evaluar las explicaciones. En una tarea sobre cambios en datos bancarios, una respuesta completa identificaría la alteración inusual, escogería un contacto de un registro consolidado y obtendría la aprobación requerida antes de actuar. Una respuesta parcial podría detectar sospechas pero pretender verificar la información a través de la misma conversación no confiable. Permita que los dinamizadores comparen varias respuestas ficticias antes de puntuar, asegurando así una aplicación uniforme de la rúbrica.

Participación: ¿Ha tomado parte el personal? Conocimiento: ¿Saben explicar la regla? Retención: ¿Pueden aplicarla más adelante? Acción en el trabajo: ¿Cambian los hábitos relevantes en su contexto real?

Ampliar imagen

Diagrama explicativo original de CyberPlay. Marco conceptual de medición; no se muestran resultados de clientes.

5. Tenga en cuenta la dificultad del escenario

La escala NIST Phish Scale proporciona un método para calificar la dificultad que supone para un ser humano detectar correos de phishing. Este modelo evalúa las pistas del mensaje y el grado de alineación de la premisa con el contexto del destinatario. Un mensaje genérico sobre un premio y una solicitud oportuna de un proveedor habitual no son elementos de prueba intercambiables. Por ello, comparar tasas brutas de clics entre distintas campañas puede inducir a error.

Para otros tipos de escenarios, documente los factores susceptibles de influir en la dificultad: información disponible, presión temporal, familiaridad, dispositivo, idioma y verosimilitud de las opciones. No es necesario atribuirse una puntuación de dificultad formalmente validada cuando no exista. Lo que sí resulta imprescindible es explicar las diferencias materiales al comparar el rendimiento entre versiones o equipos.

Mecánica de Phishing Detective 3D: inspeccionando una solicitud entrante.

Ampliar imagen · Captura del juego · Interfaz en inglés

  1. Lea la acción solicitada

    Identifique qué le pide el mensaje antes de juzgar su nombre o apariencia familiar.

  2. Verifique mediante contactos conocidos

    Utilice una vía de contacto establecida para verificar solicitudes imprevistas, aun si el remitente parece conocido.

Mecánica de Phishing Detective 3D: inspeccionando una solicitud entrante.

Fuentes de esta sección: Guía de uso de NIST Phish Scale

6. Utilice un diseño de evaluación reducido y transparente

Presentamos un diseño ilustrativo para el objetivo de verificación de pagos. Plantee a los participantes una solicitud inicial ficticia y registre la primera acción junto con su razonamiento. Instruya sobre el proceso aprobado y permita después que practiquen con retroalimentación. Más adelante, presente una solicitud modificada con información equiparable y registre una nueva respuesta independiente. Conserve la versión y el intervalo de tiempo junto a los resultados.

Una mejora observada puede respaldar una conclusión sobre el rendimiento en esos ejercicios concretos. Sin embargo, no aísla por sí sola el efecto exclusivo de la formación: la familiaridad previa, comunicaciones paralelas, cambios de personal o mejoras en los procesos pueden haber influido. Si la organización necesita una evaluación de causalidad, planifique una comparativa y un análisis adecuados con asesoramiento cualificado antes de recopilar los datos.

6. Utilice un diseño de evaluación reducido y transparente
FaseRegistroInterpretación
Línea baseVersión del escenario, primera acción y razonamientoRendimiento inicial ante esta tarea.
PrácticaRetroalimentación ofrecida e intentos completadosOportunidad para aprender y aplicar el proceso.
SeguimientoEscenario modificado, intervalo y respuesta independienteAplicación diferida en el marco del ejercicio.
RevisiónFactores de confusión y acciones de mejoraQué conclusiones y cambios pueden adoptarse de forma razonable.

7. Considere la notificación como un proceso conjunto de empleado y respuesta

Un mayor número de alertas puede reflejar una mejor concienciación, una mayor llegada de mensajes maliciosos, un botón de aviso más accesible o una campaña ruidosa. Menos avisos pueden ser fruto de filtros eficaces o de una menor exposición, no necesariamente de un mejor criterio. Vincule las cifras de notificación con su contexto y defina qué convierte a un aviso en información útil. Distinga el acuse de recibo de una investigación completada y evite exigir a los empleados que demuestren la maliciosidad antes de manifestar una sospecha.

Tenga en cuenta también la capacidad de respuesta. Si los avisos llegan a un buzón sin supervisión, formar a los usuarios para que notifiquen con mayor rapidez no solucionará ese cuello de botella. Mida si los avisos llegan al equipo adecuado y si los empleados reciben una confirmación útil cuando proceda. Utilice registros corporativos autorizados con una finalidad clara y políticas de acceso definidas, en lugar de acumular un almacén innecesario de contenidos de mensajes personales.

Mecánica de Ransomware Reaction: preparando un parte de incidentes útil.

Ampliar imagen · Captura del juego · Interfaz en inglés

  1. Indique hora y equipo

    Notifique los síntomas observados, la hora de aparición y el equipo afectado por los canales de reporte aprobados.

  2. Distinga observación de diagnóstico

    Diferencie las observaciones directas de las hipótesis causales para que el equipo investigue sin asumir conjeturas previas.

Mecánica de Ransomware Reaction: preparando un parte de incidentes útil.

8. Examine las investigaciones que cuestionan las afirmaciones de éxito fácil

Un artículo de investigación en prepublicación elaborado por Rozema y Davis, basado en un amplio estudio en una firma estadounidense de tecnología financiera, no halló efectos principales significativos de sus intervenciones formativas en las tasas de clics o de notificación, mientras que la dificultad del phishing sí predijo el comportamiento. Dichos resultados atañen estrictamente a ese estudio y a sus enfoques analizados. No evalúan a CyberPlay ni demuestran que todo diseño formativo concebible arroje el mismo resultado.

La lección fundamental es poner a prueba los supuestos. El interés de los usuarios, las altas tasas de finalización y una interfaz atractiva no eliminan la necesidad de realizar una evaluación rigurosa. Analice la intervención, la población, la definición de las variables y las limitaciones del estudio antes de extrapolar un resultado. El titular de una fuente no basta para justificar la promesa de un producto, ya sea un titular favorable o crítico hacia la formación.

Fuentes de esta sección: La formación contra el phishing sigue sin funcionar: una reproducción a gran escala

9. Conozca el alcance y los límites de los registros de CyberPlay

El modelo de sesiones de CyberPlay registra el estado y los desenlaces de cada partida, incluyendo un porcentaje comunicado y la condición de superado cuando procede, junto con métricas específicas del juego y sus detalles técnicos. Se trata de registros de actividades de aprendizaje; además, los equipos hispanohablantes se benefician de contar con la interfaz, guías y evaluaciones disponibles en español. La disponibilidad e interpretación de estos datos dependen del juego y de la vista de cuenta u organización aplicable; que exista un campo en el modelo de datos no significa que todos los juegos aporten la misma evidencia.

Considere el porcentaje, la progresión o la partida completada de un juego como evidencia circunscrita a esa actividad específica. Se requiere un escenario modificado e independiente para evaluar la aplicación diferida. La conducta real de notificación de phishing en el puesto de trabajo y las repercusiones de negocio exigen una recopilación de datos autorizada e independiente. No deduzca a partir de la puntuación de un juego que un empleado ha evitado un ataque real, ni cuantifique a través de ella una reducción del riesgo corporativo.

10. Difunda un informe conciso que detalle sus limitaciones

Un informe mensual verdaderamente útil especifica el objetivo, la audiencia, las versiones de la actividad, la participación, las decisiones demostradas y las medidas correctivas adoptadas. Incorpore la limitación principal junto al dato evaluado. En grupos pequeños, emplee cifras absolutas y observaciones cualitativas en lugar de variaciones porcentuales desmesuradas. Asegúrese de que los resultados individuales solo sean visibles para las personas que los necesiten con fines estrictamente justificados.

  • ¿Qué decisión pretendía respaldar el programa?
  • ¿Quiénes eran elegibles y quiénes pudieron acceder efectivamente a la actividad?
  • ¿Qué intento, versión del escenario y ventana temporal dieron lugar al resultado?
  • ¿Qué demuestra la evidencia recopilada y qué aspectos quedan sin medir?
  • ¿Qué modificación de los procesos o del aprendizaje se derivará de ello?
  • ¿Quién es el responsable de ese cambio y cuándo se someterá a revisión?

Lleve la decisión a la práctica

Pruebe un escenario de phishing y defina una decisión observable que pueda evaluar de manera independiente a la finalización o a la puntuación.

Explorar juegos de phishing

Fuentes y lecturas adicionales

  1. Diseño de un programa de aprendizaje sobre ciberseguridad y privacidad, SP 800-50 Rev. 1 — NIST. Consultado el 2026-09-13
  2. Guía de uso de NIST Phish Scale — NIST. Consultado el 2026-09-13
  3. La formación contra el phishing sigue sin funcionar: una reproducción a gran escala — Prepublicación de investigación, arXiv. Consultado el 2026-09-13

Sigue explorando

Todos los artículos

Contacto · Acerca de