Suno vs Udio — Como os detectores os distinguem
Suno e Udio são os dois motores text-to-music dominantes de 2026. Ambos produzem músicas completas (vocais + instrumentação) a partir de um prompt de texto em segundos. Ambos enganam o ouvinte casual. Mas por baixo dos panos usam arquiteturas muito diferentes — o que significa impressões forenses muito diferentes.
Este artigo explica exatamente como os detectores de música IA distinguem o Suno do Udio, quais sinais cada motor deixa para trás e para onde caminha a corrida armamentista da detecção.
Os dois motores — visão geral da arquitetura
Suno (Suno Inc.)
- Lançamento: dezembro de 2023
- Versão atual: v5 (março de 2026)
- Arquitetura: rumores de híbrido de difusão + decodificador de tokens
- Saída de áudio: 32 kHz reamostrado para 44,1 kHz
- Vocais: realistas, mas com uma sutil coerência de fase sintética
- Marcas d'água: Content Credentials C2PA embutidas (desde o fim de 2025)
Udio (Uncharted Labs)
- Lançamento: abril de 2024
- Versão atual: v1.5
- Arquitetura: difusão + transformer (rumores)
- Saída de áudio: 44,1 kHz nativo
- Vocais: ainda mais realistas, com baixa proeminência de pico cepstral
- Marcas d'água: SynthID opcional (parceria com o Google, fim de 2025)
Assinatura nº 1 — Artefatos de reamostragem
O Suno é muito mais fácil de detectar pela reamostragem. O pipeline do Suno gera áudio a 32 kHz e o reamostra para 44,1 kHz antes de entregar. Isso cria entalhes de frequência perto do corte de Nyquist em 16 kHz — quedas acentuadas no espectro que são invisíveis para os ouvintes, mas muito visíveis para os detectores.
O Udio gera nativamente a 44,1 kHz, então não tem artefatos de reamostragem nessa faixa. Para detectar o Udio, é preciso recorrer a outros sinais.
O que um detector mede
- Nitidez das bordas espectrais acima de 14 kHz
- Profundidade do entalhe em 16 kHz (marcador específico do Suno)
- Inclinação da queda de energia entre 15-20 kHz
Assinatura nº 2 — Proeminência do pico cepstral vocal (CPP)
O CPP mede o quão "estruturado" é um sinal vocal. As cordas vocais humanas reais produzem micropulsos glóticos que aparecem como picos acentuados no cepstro. Os vocais de IA são mais suaves — os picos são mais achatados.
- Vocais humanos reais: CPP tipicamente 12-22 dB
- Vocais do Suno v5: CPP 7-11 dB (claramente sintéticos)
- Vocais do Udio v1.5: CPP 9-14 dB (mais próximos do humano, mais difíceis de detectar)
É por isso que os vocais do Udio são os vocais de IA mais difíceis de detectar hoje. Os detectores precisam combinar o CPP com outros sinais (suavidade das transições de formantes, uniformidade do ruído de respiração) para flagrar o Udio.
Assinatura nº 3 — Geometria do campo estéreo
Ambos os motores sintetizam o estéreo a partir de uma base mono. O estéreo do Suno é artificialmente largo e simétrico. O do Udio é mais sofisticado, mas apresenta uma correlação entre canais boa demais — instrumentos reais raramente correlacionam acima de 0,93 na banda de médias frequências; tanto o Suno quanto o Udio o fazem.
| Métrica estéreo | Humano | Suno | Udio |
|---|---|---|---|
| Largura estéreo (200-2k Hz) | 0,7–1,4 | 1,6–2,1 | 1,3–1,7 |
| Correlação L/R na banda média | 0,78–0,91 | 0,94–0,98 | 0,92–0,97 |
| Pontuação de simetria de fase | variável | uniforme demais | moderadamente uniforme |
Assinatura nº 4 — A costura do "extend" do Suno
Quando os usuários estendem faixas do Suno além de 4 minutos, o Suno costura novos segmentos. As junções deixam pequenas descontinuidades espectrais a cada 60-120 segundos — uma impressão digital reveladora do Suno. O recurso "extend" do Udio é mais suave, mas ainda detectável por análise cepstral nos pontos de transição.
Assinatura nº 5 — Marcas d'água C2PA e SynthID
Quando há marcas d'água presentes, a detecção é trivial — basta lê-las.
- Suno: embute Content Credentials C2PA (manifestos assinados) em muitas saídas desde o fim de 2025
- Udio: suporta a marca d'água SynthID do Google (esteganografia de áudio) desde novembro de 2025
Mas muitos usuários removem as marcas d'água recodificando o áudio. A detecção forense (assinaturas 1-4) flagra esses casos.
Benchmarks de precisão — detecção de Suno vs Udio
| Detector | Suno v5 | Udio v1.5 | Atribuição cruzada |
|---|---|---|---|
| AI Song Checker | 99,4% | 98,7% | 94% correto |
| authio | 99,1% | 98,5% | 91% correto |
| IRCAM Amplify | ~99% | ~98% | não divulgado |
| letssubmit bAbI v2 | 89% | 85% | 74% correto |
| aimusicchecker.org | 92% | 87% | sem atribuição |
"Atribuição cruzada" = o detector identifica corretamente qual motor (Suno ou Udio) fez a faixa, e não apenas se é "IA".
Como o AI Song Checker lida com os dois
Nosso motor ASC v8.3 combina todas as 5 famílias de assinatura (reamostragem, CPP, estéreo, costura, marcas d'água) mais 80+ outros sinais forenses, ponderados por um modelo bayesiano treinado em ~250.000 faixas rotuladas. As pontuações de atribuição de plataforma são retornadas junto com a probabilidade de IA:
- Experimente nosso Detector de Suno — otimizado para Suno v3.5/v4/v5
- Experimente nosso Detector de Udio — otimizado para Udio v1.0/v1.5
- Ou use o verificador geral — atribuição automática ao motor que melhor corresponder
A corrida armamentista — o que vem a seguir
Espera-se que o Suno v6 (rumores para o segundo semestre de 2026) traga saída nativa em 44,1 kHz, eliminando a assinatura de reamostragem. O Udio v2 (também sob rumores) mira um CPP vocal de nível humano. A detecção exige recalibração contínua.
Nossa equipe publica registros de recalibração semanalmente (saiba mais). A Authio e o IRCAM atualizam mensalmente. A maioria das outras ferramentas recalibra trimestralmente ou nunca.