Vox Trust
No detectes voces falsas. Prueba las reales.
Un protocolo abierto, con implementación de referencia en Rust, que sella la voz humana en origen para que cualquiera pueda verificarla después.
El problema
Clonar una voz hoy requiere solo unos segundos de audio. Nuestros oídos ya no distinguen una voz real de una clonada, y los detectores persiguen un blanco móvil: cuando mejora la detección, también mejora la generación.
Atestiguar lo real, en lugar de adivinar lo falso
En lugar de preguntar "¿esta voz es falsa?", Vox Trust pregunta "¿se selló una voz real?"
- Sellar. El dispositivo de quien habla añade al audio un sello firmado, en origen.
- Transportar. El sello puede viajar en una marca de agua de audio intercambiable, para sobrevivir a la recodificación. Un primer portador, experimental, está construido y medido en público: sobrevive a MP3, AAC y Opus, pero no a los códecs de llamadas telefónicas ni al ruido.
- Verificar. Cualquiera que use el protocolo comprueba qué clave selló el audio, cuándo y qué segundos fueron alterados.
- Decidir. Una política de confianza local convierte el resultado en uno de cuatro veredictos.
Cuatro veredictos
Verificado
Un sello válido de una clave en la que confías.
Sin sello
Sin sello, de alguien que nunca usó el protocolo. Neutro, no "falso".
Aviso
Sin sello, de un contacto que suele sellar. Ten cuidado y pídele que lo envíe de nuevo.
Alerta
Un sello roto, un sello de otra clave distinta a la que tienes para ese contacto, o ninguno de un contacto que siempre sella, en modo estricto.
Ilustración de los veredictos de la política. La demo en vivo ejecuta el núcleo real en Rust en tu navegador; no se sube nada.
Cómo se compara
Los demás marcan la voz falsa. Vox Trust sella la verdadera.
Google, Meta, Microsoft y Resemble marcan el audio que generan sus propias IA. Los detectores de deepfakes estiman si una voz es sintética. Vox Trust permite que quien habla selle su propia voz, y cualquiera lo comprueba con criptografía común.
| Vox Trust | Google SynthID | Meta AudioSeal | Detectores de deepfakes | C2PA | |
|---|---|---|---|---|---|
| Avala una grabación humana real | Sí | Nomarca salida de IA | Nomarca salida de IA | Estima | Si la app firma |
| Prueba ligada a la clave del propio hablante | Sí | No | No | No | Sí |
| Señala los segundos alterados | Sí | No | En parte | No | Noarchivo completo |
| Cualquiera verifica, sin conexión | Síen el navegador | Nodetector de Google | Sí | No | Sí |
| Especificación y código abiertos | Sí | Nopara audio | Código | No | Especificación |
| Sobrevive a MP3, AAC, Opus | Experimental100 % medido | Declarado | Medido | n/a | Nometadatos eliminados |
| Sobrevive a llamadas | Aún no11 % | No publicado | No0 % medido | Sí | No |
| Coste de verificar | Milisegundossin modelo de IA | Nube | Red neuronal | Nube | Milisegundos |
"Medido" significa ejecutado en nuestro benchmark público, con el mismo corpus y los mismos códecs; "declarado" es la cifra publicada por el proveedor. Detectores de deepfakes: por ejemplo Pindrop Pulse. La fuente de cada celda está en las notas de la comparación (en inglés).
Intégralo en tu app
Vox Trust es un protocolo abierto pensado para vivir dentro de las apps que la gente ya usa: mensajería, buzón de voz, herramientas de pódcast y de redacción, plataformas de atención. Sella al enviar, verifica al recibir. Un núcleo WebAssembly de 93 KB sin dependencias, en el navegador o en Node, o un crate de Rust.
npm install vox-trust
cargo add vox-trust-core
import { load } from "vox-trust";
const vt = await load();
const sealed = vt.seal(wav, {
mode: "public", key: seed, createdUnix, chunkFrames: 16000,
});
const report = vt.verify(sealed, { pinnedPublicKey });
vt.decide(report.check, contact); // "verified" | "unsealed" | "warning" | "alert"
La guía de integración (en inglés) lleva unos 10 minutos, con ejemplos para Node, el navegador y Rust. Apache-2.0, sin servicio que llamar, sin cuenta.
También: pip install vox-trust (Python), bibliotecas para Android e iOS adjuntas a cada release, una extensión de navegador para Chrome, Firefox y Safari, y un servidor MCP para que asistentes de IA verifiquen grabaciones.
Lo que no es
- No es detección de deepfakes ni biometría de voz.
- No prueba que quien habla sea humano ni que sea quien dice ser. Prueba que una clave selló el audio. Una clave robada produce sellos válidos.
- "Sin sello" no significa "falso": la compresión y la supresión de ruido pueden borrar una marca de agua.
- No protege frente a quien controla el dispositivo del remitente.
La lista completa de atacantes y límites está en el modelo de amenazas (en inglés).
Dónde estamos
- Una especificación (versión 0.2: modo archivo como release candidate, partes dentro del audio experimentales) y un modelo de amenazas, abiertos a críticas.
- Una implementación de referencia en Rust con modo archivo (un manifiesto firmado por fragmento dentro de un WAV), política de confianza, herramienta de línea de comandos y compilación a WebAssembly. Los vectores de prueba están publicados y los contrasta una segunda implementación en Python, escrita por el mismo autor.
- Una demo en vivo que verifica de verdad. Los archivos sellados solo sobreviven a copias idénticas bit a bit; los veredictos salen solo del modo archivo.
- Sin auditar. Todavía no hay revisión independiente. No lo uses para proteger a nadie.
- Medido: la marca de agua experimental (stdm-2) conserva el sello en MP3, AAC, Opus 24 y 32 kbit/s y G.722 (100 %), en MP3 reenviado como Opus (98 %) y con un cambio de velocidad del 1 % (84 %), sin falsas alarmas, pero todavía falla en llamadas (AMR-WB), con ruido fuerte y con eco. Un sello dentro del audio puede copiarse a otro audio, así que todavía no da veredictos. Resultados completos (en inglés).
Consulta la hoja de ruta (en inglés).
Construido sobre trabajo existente y junto a él
Vox Trust pretende complementar estas iniciativas, no sustituirlas:
- Las credenciales de contenido C2PA, que ya usan marcas de agua como "soft bindings".
- Marcas de agua de audio como AudioSeal y WavMark, que pueden servir de portadoras.
- La investigación sobre procedencia del habla con clave pública, como MerkleSpeech.
Ayúdanos a romperlo
Lo más útil ahora es el escrutinio: lee el modelo de amenazas, encuentra al atacante que se nos pasó o reproduce una medición. Abre una incidencia en GitHub. Las vulnerabilidades se comunican en privado, como describe la política de seguridad.