Vox Trust › Comparação
Vox Trust vs Google SynthID, Meta AudioSeal e detectores de deepfake
Google SynthID, Meta AudioSeal, Microsoft e Resemble marcam o áudio que as próprias IAs geram, para que ele seja reconhecido depois. Detectores de deepfake estimam se uma voz é sintética. O Vox Trust faz o contrário: quem fala sela a própria voz, e qualquer pessoa confere com criptografia comum.
Recursos lado a lado
| Vox Trust | Google SynthID | Meta AudioSeal | Detectores de deepfake | C2PA | |
|---|---|---|---|---|---|
| Garante uma gravação humana real | Sim | Nãomarca saída de IA | Nãomarca saída de IA | Estima | Se o app assinar |
| Prova ligada à chave do próprio falante | Sim | Não | Não | Não | Sim |
| Aponta os segundos alterados | Sim | Não | Em parte | Não | Nãoarquivo inteiro |
| Qualquer pessoa verifica, offline | Simno navegador | Nãodetector do Google | Sim | Não | Sim |
| Especificação e código abertos | Sim | Nãopara áudio | Código | Não | Especificação |
| Sobrevive a MP3, AAC, Opus | Experimental100 % medido | Declarado | Medido | n/a | Nãometadados removidos |
| Sobrevive a ligações | Ainda não11 % | Não publicado | Não0 % medido | Sim | Não |
| Custo para verificar | Milissegundossem modelo de IA | Nuvem | Rede neural | Nuvem | Milissegundos |
"Medido" significa rodado no nosso benchmark público, com o mesmo corpus e os mesmos codecs; "declarado" é o número publicado pelo fornecedor. A fonte de cada célula está nas notas da comparação (em inglês).
Marcas d'água medidas no mesmo teste
13 gravações em 10 idiomas, os mesmos codecs reais e as mesmas métricas de qualidade. AudioSeal e WavMark carregaram uma mensagem de 16 bits repetida na gravação inteira, tarefa mais fácil que a de um selo de 102 bits a cada 9,6 s; para eles, os números são um teto.
| Condição | Vox Trust stdm-2 | Meta AudioSeal | WavMark |
|---|---|---|---|
| MP3, AAC, Opus 24 kbit/s | 100 % | 100 % | 100 % (Opus) |
| G.722 (VoIP) | 100 % | 0 % | não medido |
| Início do áudio cortado | 100 % | 8 % | não medido |
| Velocidade +1 % | 84 % | 62 % | 100 % |
| Ruído 30 dB | 51 % | 100 % | não medido |
| Eco | 0 % | 100 % | 100 % |
| Redução de ruído | 7 % | 0 % | 100 % |
| Ligação (AMR-WB 12.65 kbit/s) | 11 % | 0 % | 31 % |
| Alarme falso em áudio sem marca | 0 | 0 | 0 |
| Custo para verificar | milissegundos | rede neural | minutos em CPU |
Dados completos e como reproduzir: resultados do benchmark (em inglês). O Google SynthID não pôde ser medido: o detector de áudio dele não é público.
Perguntas frequentes
O Vox Trust é uma alternativa ao Google SynthID?
Resolve outro problema. O SynthID marca o áudio feito pela IA do Google para que ele seja reconhecido como sintético. O Vox Trust deixa uma pessoa real selar as próprias gravações, para que quem recebe confira se são genuínas e não foram alteradas. Os dois podem coexistir.
O Vox Trust detecta deepfakes?
Não. Ele não tenta adivinhar se uma voz é falsa. Ele prova que uma gravação foi selada por uma chave conhecida e mostra quais segundos mudaram. Áudio sem selo é neutro, não "falso".
Qual a diferença para o AudioSeal ou o WavMark?
Eles são marcas d'água: escondem uma mensagem curta no áudio. O Vox Trust é um protocolo por cima disso: selo criptográfico, política de confiança e localização exata de edições. Uma marca d'água como o AudioSeal ou o WavMark poderia carregar o selo do Vox Trust; medimos as duas como candidatas.
O Vox Trust é código aberto?
Sim: a especificação, a implementação em Rust, os vetores de teste e o benchmark, inclusive as condições em que ainda falha.