Vox Trust
v0.6.0 · modo arquivo funciona · sem auditoria

Vox Trust

Não detecte vozes falsas. Prove as reais.

Um protocolo aberto, com implementação de referência em Rust, que sela a voz humana na origem para que qualquer pessoa possa verificá-la depois.

O problema

Clonar uma voz hoje exige poucos segundos de áudio. Nossos ouvidos já não distinguem uma voz real de uma clonada, e os detectores correm atrás de um alvo móvel: quando a detecção melhora, a geração também melhora.

Atestar o real, em vez de adivinhar o falso

Em vez de perguntar "essa voz é falsa?", o Vox Trust pergunta "uma voz real foi selada?"

  1. Selar. O aparelho de quem fala adiciona ao áudio um selo assinado, na origem.
  2. Carregar. O selo pode viajar numa marca d'água de áudio plugável, para sobreviver à recompressão. Uma primeira portadora, experimental, foi construída e medida em público: sobrevive a MP3, AAC e Opus, mas não a codecs de ligação telefônica nem a ruído.
  3. Verificar. Qualquer pessoa com o protocolo confere qual chave selou o áudio, quando, e quais segundos foram alterados.
  4. Decidir. Uma política de confiança local transforma o resultado em um de quatro vereditos.

Quatro vereditos

Verificado

Um selo válido de uma chave em que você confia.

Sem selo

Sem selo, vindo de quem nunca usou o protocolo. Neutro, não "falso".

Aviso

Sem selo, vindo de um contato que costuma selar. Cuidado: peça que envie de novo.

Alerta

Selo quebrado, selo de outra chave que não a que você tem para esse contato, ou nenhum selo de um contato que sempre sela, no modo estrito.

Ilustração dos vereditos da política. A demo ao vivo roda o núcleo Rust de verdade no seu navegador; nada é enviado.

Como se compara

Os outros marcam a voz falsa. O Vox Trust sela a verdadeira.

Google, Meta, Microsoft e Resemble marcam o áudio que as próprias IAs geram. Detectores de deepfake estimam se uma voz é sintética. O Vox Trust deixa quem fala selar a própria voz, e qualquer pessoa confere com criptografia comum.

Vox TrustGoogle SynthIDMeta AudioSealDetectores de deepfakeC2PA
Garante uma gravação humana realSimNãomarca saída de IANãomarca saída de IAEstimaSe o app assinar
Prova ligada à chave do próprio falanteSimNãoNãoNãoSim
Aponta os segundos alteradosSimNãoEm parteNãoNãoarquivo inteiro
Qualquer pessoa verifica, offlineSimno navegadorNãodetector do GoogleSimNãoSim
Especificação e código abertosSimNãopara áudioCódigoNãoEspecificação
Sobrevive a MP3, AAC, OpusExperimental100 % medidoDeclaradoMedidon/aNãometadados removidos
Sobrevive a ligaçõesAinda não11 %Não publicadoNão0 % medidoSimNão
Custo para verificarMilissegundossem modelo de IANuvemRede neuralNuvemMilissegundos

"Medido" significa rodado no nosso benchmark público, com o mesmo corpus e os mesmos codecs; "declarado" é o número publicado pelo fornecedor. Detectores de deepfake: por exemplo o Pindrop Pulse. A fonte de cada célula está nas notas da comparação (em inglês).

Comparação completa, resultados medidos e perguntas frequentes →

Coloque no seu app

Vox Trust é um protocolo aberto feito para viver dentro dos apps que as pessoas já usam: mensageiros, correio de voz, ferramentas de podcast e de redação, plataformas de atendimento. Sela ao enviar, verifica ao receber. Um núcleo WebAssembly de 93 KB sem dependências, no navegador ou no Node, ou um crate Rust.

npm install vox-trust
cargo add vox-trust-core

import { load } from "vox-trust";
const vt = await load();
const sealed = vt.seal(wav, {
  mode: "public", key: seed, createdUnix, chunkFrames: 16000,
});
const report = vt.verify(sealed, { pinnedPublicKey });
vt.decide(report.check, contact); // "verified" | "unsealed" | "warning" | "alert"

O guia de integração (em inglês) leva uns 10 minutos, com exemplos para Node, navegador e Rust. Apache-2.0, sem serviço para chamar, sem conta.

Também: pip install vox-trust (Python), bibliotecas para Android e iOS anexadas a cada release, uma extensão de navegador para Chrome, Firefox e Safari, e um servidor MCP para assistentes de IA verificarem gravações.

O que ele não é

  • Não é detecção de deepfake nem biometria de voz.
  • Não prova que quem fala é humano ou é quem diz ser. Prova que uma chave selou o áudio. Uma chave roubada gera selos válidos.
  • "Sem selo" não significa "falso": compressão e redução de ruído podem apagar uma marca d'água.
  • Não protege contra quem controla o aparelho de quem envia.

A lista completa de atacantes e limites está no modelo de ameaças (em inglês).

Onde estamos

  • Uma especificação (versão 0.2: modo arquivo como release candidate, partes dentro do áudio experimentais) e um modelo de ameaças, abertos a críticas.
  • Uma implementação de referência em Rust com modo arquivo (manifesto assinado por trecho dentro de um WAV), política de confiança, ferramenta de linha de comando e build WebAssembly. Vetores de teste publicados e conferidos por uma segunda implementação, em Python, escrita pelo mesmo autor.
  • Uma demo ao vivo que verifica de verdade. Arquivos selados sobrevivem só a cópias idênticas; os vereditos vêm apenas do modo arquivo.
  • Sem auditoria. Ainda não houve revisão independente. Não use para proteger ninguém.
  • Medido: a marca d'água experimental (stdm-2) mantém o selo em MP3, AAC, Opus 24 e 32 kbit/s e G.722 (100 %), em MP3 reencaminhado como Opus (98 %) e numa mudança de velocidade de 1 % (84 %), sem alarmes falsos, mas ainda falha em ligações (AMR-WB), ruído forte e eco. Um selo dentro do áudio pode ser copiado para outro áudio, então ela ainda não dá vereditos. Resultados completos (em inglês).

Veja o roadmap (em inglês).

Construído sobre, e ao lado de, trabalhos existentes

O Vox Trust pretende complementar estes, não substituí-los:

  • Credenciais de conteúdo C2PA, que já usam marcas d'água como "soft bindings".
  • Marcas d'água de áudio como AudioSeal e WavMark, que podem servir de portadoras.
  • Pesquisa sobre procedência de fala com chave pública, como o MerkleSpeech.

Ajude a quebrar

O mais útil agora é o escrutínio: leia o modelo de ameaças, ache o atacante que esquecemos, ou reproduza uma medição. Abra uma issue no GitHub. Vulnerabilidades devem ser reportadas em privado, como descrito na política de segurança.