Contexto: cuando la voz ya no es garantía de identidad
En 2019, el Wall Street Journal publicó el primer caso documentado de deepfake de audio para fraude empresarial: atacantes usaron IA para clonar la voz del director general de una empresa energética alemana y convencer al CEO de la filial británica de transferir 220.000 euros a una cuenta fraudulenta. Cinco años después, la tecnología es notablemente más accesible, el audio resultante más convincente y los casos más frecuentes.
El FBI publicó en enero de 2026 una alerta urgente sobre el incremento de deepfakes de audio en ataques de Business Email Compromise (BEC) y fraude de directivos, documentando pérdidas superiores a 780 millones de dólares en el año anterior solo en EE.UU. En Europa, el informe de Europol sobre cibercrimen financiero de 2026 identifica el deepfake de audio como una amenaza emergente con impacto creciente en el sector financiero y las pymes de servicios profesionales.
Cómo funciona técnicamente la clonación de voz con IA
El proceso de clonación: de la muestra al audio sintético
Los modelos modernos de síntesis de voz (Text-to-Speech con clonación) necesitan entre 30 segundos y 3 minutos de audio de la víctima para generar una réplica convincente. Este material se obtiene de fuentes públicas: vídeos de YouTube, entrevistas en podcast, presentaciones en conferencias, redes sociales o incluso mensajes de voz enviados previamente. Herramientas como ElevenLabs, Coqui o modelos de código abierto como XTTS permiten a cualquier persona con conocimientos técnicos básicos clonar una voz en cuestión de minutos.
La llamada fraudulenta: urgencia y autoridad
El atacante llama al empleado objetivo (habitualmente del departamento financiero) usando la voz sintética del directivo. La llamada reproduce patrones de comunicación habituales del suplantado —expresiones recurrentes, tono, ritmo de habla— que refuerzan la credibilidad. El pretexto suele combinar urgencia artificial («necesito esto antes del cierre de mercado»), confidencialidad («no lo comentes aún con nadie, es una adquisición sensible») y presión jerárquica que inhibe la verificación.
Variante: deepfake de vídeo en tiempo real
En 2025 surgieron los primeros casos documentados de deepfake de vídeo en videollamadas corporativas, donde el atacante aparece con el rostro y la voz del directivo suplantado en tiempo real mediante herramientas como DeepFaceLive. En 2026, estos ataques requieren un ancho de banda y potencia de procesamiento significativos, pero la barrera técnica sigue descendiendo. El caso más notorio involucró a una empresa financiera de Hong Kong que perdió 25 millones de dólares en una «reunión» con personas totalmente sintéticas.
Sectores y perfiles más afectados
Los ataques de CEO Fraud 2.0 con deepfake de audio afectan prioritariamente a:
- Departamentos financieros de pymes: donde una sola persona tiene autoridad para ejecutar transferencias y la verificación de identidad no está sistematizada.
- Despachos de abogados y notarías: donde las transacciones de grandes sumas son habituales y la urgencia en operaciones está justificada por el contexto.
- Empresas de construcción e inmobiliarias: con transacciones de alta cuantía que pueden desviarse mediante instrucciones fraudulentas de cambio de cuenta bancaria.
- Contables y asesores fiscales: que gestionan cuentas de múltiples clientes y pueden ser vectores de ataque hacia terceros.
Qué debería hacer una empresa para protegerse del CEO Fraud con deepfake
- Evaluar la exposición pública de la voz de directivos: auditar qué material de audio y vídeo de ejecutivos está disponible públicamente en YouTube, podcasts, redes sociales y webs corporativas.
- Implementar protocolos de verificación dual para transferencias: ninguna transferencia por encima de un umbral definido (p.ej. 5.000 euros) debe ejecutarse sin verificación por un canal independiente (llamada al número conocido, no al que llama, o confirmación por correo al directivo).
- Establecer palabras clave de verificación interna: «palabras de emergencia» o códigos que los directivos pueden usar en llamadas legítimas urgentes y que los empleados deben solicitar cuando la petición es inusual.
- Revisar los procedimientos de cambio de datos bancarios de proveedores: cualquier solicitud de cambio de cuenta bancaria de un proveedor debe verificarse telefónicamente con el contacto habitual antes de actualizarse en el sistema.
- Entrenar al personal financiero con simulaciones específicas: incluir escenarios de deepfake de audio en la formación de concienciación. La experiencia práctica es más efectiva que la formación teórica.
- Proteger los datos de directivos con restricciones de privacidad: limitar la exposición pública de audio y vídeo que pueda usarse para entrenar modelos de clonación.
- Contactar con un especialista ante una sospecha de fraude: si se sospecha que una transferencia fue ejecutada bajo engaño, el tiempo es crítico. El análisis forense puede identificar el origen del audio sintético y apoyar una denuncia ante las fuerzas de seguridad.
Preguntas frecuentes
¿Es posible detectar un deepfake de audio en tiempo real durante una llamada?
La detección automatizada en tiempo real es técnicamente posible pero no está disponible de forma generalizada en entornos corporativos en 2026. Las señales humanas de alerta incluyen: latencia inusual en la respuesta, tono ligeramente mecánico, respuestas que evitan preguntas personales específicas o falta de contexto que el directivo real conocería. El mejor detector sigue siendo el procedimiento: verificación por canal independiente ante cualquier solicitud financiera inusual.
¿Cuánto audio necesita un atacante para clonar una voz?
Con herramientas actuales, entre 30 segundos y 3 minutos de audio limpio son suficientes para generar una réplica funcional. Con más material de entrenamiento, la calidad mejora. Una entrevista de 10 minutos en YouTube o un episodio de podcast son suficientes para un ataque creíble.
¿El CEO Fraud con deepfake es un delito en España?
Sí. Se persigue bajo múltiples tipos penales del Código Penal español: estafa (art. 248), usurpación de identidad (art. 401), falsedad documental si se falsifican correos o documentos (arts. 390 y ss.), y potencialmente delitos informáticos (art. 197 bis). El uso de deepfake de audio es considerado un agravante en la valoración judicial de la sofisticación del engaño.
¿Qué evidencias debo preservar si creo que fui víctima de este fraude?
Preserva inmediatamente: el historial de la llamada (fecha, hora, número llamante), cualquier grabación si existiera, los correos previos o posteriores asociados, los registros de la transferencia bancaria y cualquier comunicación con el banco para intentar revertirla. No borres nada y contacta a un perito informático y a tu entidad bancaria simultáneamente.
¿Puede el banco recuperar el dinero transferido por fraude deepfake?
Depende de la velocidad de reacción y el destino del dinero. Si la transferencia es SEPA y el banco receptor coopera, puede ser reversible en horas. Si el dinero se convirtió a criptomoneda o se transfirió a cuentas internacionales, la recuperación es mucho más difícil. La denuncia inmediata a la Policía y al banco aumenta significativamente las probabilidades de recuperación parcial o total.
¿Qué es el número de verificación de llamada (STIR/SHAKEN)?
STIR/SHAKEN es un conjunto de estándares para autenticar llamadas telefónicas y combatir el spoofing de número. Implementado en EE.UU. desde 2021 y en proceso de adopción en Europa, permite que los operadores telefónicos certifiquen que el número que aparece en el identificador de llamada corresponde al número real de origen. Sin embargo, en 2026 su implementación en España no es universal y no impide el spoofing en todas las rutas de llamada.
¿Cómo puede ayudar un perito informático en un caso de deepfake de audio?
El perito puede realizar análisis forense del audio si existe grabación, identificando patrones de síntesis artificial (artefactos de modelo, inconsistencias espectrales). También puede rastrear la infraestructura utilizada para la llamada, elaborar el informe técnico para la denuncia penal y cuantificar el daño económico para reclamaciones civiles y ante aseguradoras.
¿Tu empresa tiene un protocolo anti-fraude para transferencias urgentes?
La tecnología del deepfake de audio avanza más rápido que los procedimientos de las organizaciones para detectarla. La primera línea de defensa no es técnica: es organizativa. ¿Ha implementado tu empresa algún protocolo de verificación dual o palabras clave de seguridad? ¿Ha recibido tu equipo financiero formación específica sobre este tipo de fraude? Comparte tu experiencia en los comentarios: el intercambio de buenas prácticas entre empresas es la defensa más efectiva a nivel colectivo.
¿Has sido víctima de un fraude por deepfake o sospecha que tu empresa está en riesgo?
En CiberPerito360 y NYXQLAB analizamos incidentes de fraude empresarial, elaboramos informes periciales para procedimientos judiciales y asesoramos en la implementación de controles preventivos contra el CEO Fraud y los ataques de ingeniería social avanzada. Contacta con nuestros peritos informáticos para una evaluación de tu exposición al riesgo.
Referencias
FBI — Business Email Compromise | Europol — IOCTA 2026 Cibercrimen Financiero | INCIBE — Alerta Fraude del CEO | Policía Nacional — Delitos Tecnológicos | Guardia Civil — Delitos Telemáticos