Vox Trust
v0.6.0 · el modo archivo funciona · sin auditar

Vox Trust

No detectes voces falsas. Prueba las reales.

Un protocolo abierto, con implementación de referencia en Rust, que sella la voz humana en origen para que cualquiera pueda verificarla después.

El problema

Clonar una voz hoy requiere solo unos segundos de audio. Nuestros oídos ya no distinguen una voz real de una clonada, y los detectores persiguen un blanco móvil: cuando mejora la detección, también mejora la generación.

Atestiguar lo real, en lugar de adivinar lo falso

En lugar de preguntar "¿esta voz es falsa?", Vox Trust pregunta "¿se selló una voz real?"

  1. Sellar. El dispositivo de quien habla añade al audio un sello firmado, en origen.
  2. Transportar. El sello puede viajar en una marca de agua de audio intercambiable, para sobrevivir a la recodificación. Un primer portador, experimental, está construido y medido en público: sobrevive a MP3, AAC y Opus, pero no a los códecs de llamadas telefónicas ni al ruido.
  3. Verificar. Cualquiera que use el protocolo comprueba qué clave selló el audio, cuándo y qué segundos fueron alterados.
  4. Decidir. Una política de confianza local convierte el resultado en uno de cuatro veredictos.

Cuatro veredictos

Verificado

Un sello válido de una clave en la que confías.

Sin sello

Sin sello, de alguien que nunca usó el protocolo. Neutro, no "falso".

Aviso

Sin sello, de un contacto que suele sellar. Ten cuidado y pídele que lo envíe de nuevo.

Alerta

Un sello roto, un sello de otra clave distinta a la que tienes para ese contacto, o ninguno de un contacto que siempre sella, en modo estricto.

Ilustración de los veredictos de la política. La demo en vivo ejecuta el núcleo real en Rust en tu navegador; no se sube nada.

Cómo se compara

Los demás marcan la voz falsa. Vox Trust sella la verdadera.

Google, Meta, Microsoft y Resemble marcan el audio que generan sus propias IA. Los detectores de deepfakes estiman si una voz es sintética. Vox Trust permite que quien habla selle su propia voz, y cualquiera lo comprueba con criptografía común.

Vox TrustGoogle SynthIDMeta AudioSealDetectores de deepfakesC2PA
Avala una grabación humana realSíNomarca salida de IANomarca salida de IAEstimaSi la app firma
Prueba ligada a la clave del propio hablanteSíNoNoNoSí
Señala los segundos alteradosSíNoEn parteNoNoarchivo completo
Cualquiera verifica, sin conexiónSíen el navegadorNodetector de GoogleSíNoSí
Especificación y código abiertosSíNopara audioCódigoNoEspecificación
Sobrevive a MP3, AAC, OpusExperimental100 % medidoDeclaradoMedidon/aNometadatos eliminados
Sobrevive a llamadasAún no11 %No publicadoNo0 % medidoSíNo
Coste de verificarMilisegundossin modelo de IANubeRed neuronalNubeMilisegundos

"Medido" significa ejecutado en nuestro benchmark público, con el mismo corpus y los mismos códecs; "declarado" es la cifra publicada por el proveedor. Detectores de deepfakes: por ejemplo Pindrop Pulse. La fuente de cada celda está en las notas de la comparación (en inglés).

Comparación completa (en inglés) →

Intégralo en tu app

Vox Trust es un protocolo abierto pensado para vivir dentro de las apps que la gente ya usa: mensajería, buzón de voz, herramientas de pódcast y de redacción, plataformas de atención. Sella al enviar, verifica al recibir. Un núcleo WebAssembly de 93 KB sin dependencias, en el navegador o en Node, o un crate de Rust.

npm install vox-trust
cargo add vox-trust-core

import { load } from "vox-trust";
const vt = await load();
const sealed = vt.seal(wav, {
  mode: "public", key: seed, createdUnix, chunkFrames: 16000,
});
const report = vt.verify(sealed, { pinnedPublicKey });
vt.decide(report.check, contact); // "verified" | "unsealed" | "warning" | "alert"

La guía de integración (en inglés) lleva unos 10 minutos, con ejemplos para Node, el navegador y Rust. Apache-2.0, sin servicio que llamar, sin cuenta.

También: pip install vox-trust (Python), bibliotecas para Android e iOS adjuntas a cada release, una extensión de navegador para Chrome, Firefox y Safari, y un servidor MCP para que asistentes de IA verifiquen grabaciones.

Lo que no es

  • No es detección de deepfakes ni biometría de voz.
  • No prueba que quien habla sea humano ni que sea quien dice ser. Prueba que una clave selló el audio. Una clave robada produce sellos válidos.
  • "Sin sello" no significa "falso": la compresión y la supresión de ruido pueden borrar una marca de agua.
  • No protege frente a quien controla el dispositivo del remitente.

La lista completa de atacantes y límites está en el modelo de amenazas (en inglés).

Dónde estamos

  • Una especificación (versión 0.2: modo archivo como release candidate, partes dentro del audio experimentales) y un modelo de amenazas, abiertos a críticas.
  • Una implementación de referencia en Rust con modo archivo (un manifiesto firmado por fragmento dentro de un WAV), política de confianza, herramienta de línea de comandos y compilación a WebAssembly. Los vectores de prueba están publicados y los contrasta una segunda implementación en Python, escrita por el mismo autor.
  • Una demo en vivo que verifica de verdad. Los archivos sellados solo sobreviven a copias idénticas bit a bit; los veredictos salen solo del modo archivo.
  • Sin auditar. Todavía no hay revisión independiente. No lo uses para proteger a nadie.
  • Medido: la marca de agua experimental (stdm-2) conserva el sello en MP3, AAC, Opus 24 y 32 kbit/s y G.722 (100 %), en MP3 reenviado como Opus (98 %) y con un cambio de velocidad del 1 % (84 %), sin falsas alarmas, pero todavía falla en llamadas (AMR-WB), con ruido fuerte y con eco. Un sello dentro del audio puede copiarse a otro audio, así que todavía no da veredictos. Resultados completos (en inglés).

Consulta la hoja de ruta (en inglés).

Construido sobre trabajo existente y junto a él

Vox Trust pretende complementar estas iniciativas, no sustituirlas:

  • Las credenciales de contenido C2PA, que ya usan marcas de agua como "soft bindings".
  • Marcas de agua de audio como AudioSeal y WavMark, que pueden servir de portadoras.
  • La investigación sobre procedencia del habla con clave pública, como MerkleSpeech.

Ayúdanos a romperlo

Lo más útil ahora es el escrutinio: lee el modelo de amenazas, encuentra al atacante que se nos pasó o reproduce una medición. Abre una incidencia en GitHub. Las vulnerabilidades se comunican en privado, como describe la política de seguridad.