Podcast com duas ou três pessoas no vertical: os enquadramentos que seguram
Podcast com mais de uma pessoa não cabe inteiro num quadro 9:16, e o erro mais comum é tentar fazer caber. Existem quatro enquadramentos que funcionam, cada um para um tipo de trecho, e a escolha entre eles decide mais retenção do que a legenda ou o gancho.

Podcast com duas ou três pessoas no vertical: os enquadramentos que seguram
O fato: um podcast gravado em 16:9 com duas pessoas lado a lado não cabe num quadro 9:16 sem perder alguém. Existem quatro enquadramentos que resolvem isso: tela cheia em quem fala, tela dividida, vídeo inteiro com fundo desfocado e plano de reação. Cada um serve para um tipo de trecho, e escolher errado custa mais retenção do que qualquer legenda mal feita.
O erro mais comum não é escolher o enquadramento errado. É escolher um só e usar no corte inteiro.
Por que podcast é o formato mais difícil de verticalizar
Gameplay tem webcam e tela, e a solução virou padrão. Vlog já é gravado com uma pessoa no centro. Podcast é o pior caso: duas ou três pessoas espalhadas na horizontal, cada uma com microfone na frente da boca, e o conteúdo mora justamente na troca entre elas.
Quando você recorta 9:16 de um vídeo 16:9 na mesma altura, sobra cerca de um terço da largura original (608 de 1920 pixels, num vídeo 1080p). Enquadrar os dois rostos ao mesmo tempo, sem dividir a tela, quase sempre significa rostos minúsculos. Rosto pequeno em feed vertical é o sinal mais rápido de "não vale parar", que é o problema que tratamos em taxa de pulo.
Então a pergunta certa não é "como caber todo mundo", é "quem precisa estar na tela neste segundo".
Os quatro enquadramentos e quando usar cada um
1. Tela cheia em quem fala
O recorte fecha no rosto de quem está falando e troca quando a fala muda de dono.
Use quando: uma pessoa conta uma história, explica uma ideia ou dá uma opinião longa. É o enquadramento padrão da maioria dos cortes de podcast, porque a maior parte dos bons trechos tem um protagonista.
Cuidado com: trocar a cada "é", "sim", "nossa". Interjeição de quem escuta não é troca de fala.
2. Tela dividida
Um rosto em cada metade, empilhados: um em cima, outro embaixo.
Use quando: as duas pessoas participam do momento ao mesmo tempo. Discussão com resposta rápida, piada com réplica, entrevista em que a pergunta é tão importante quanto a resposta.
Cuidado com: trecho longo de uma pessoa só. A metade de quem está calado vira espaço morto, e o rosto de quem fala fica com metade do tamanho que poderia ter.
3. Vídeo inteiro com fundo desfocado
O quadro original inteiro numa faixa horizontal no meio, com uma versão ampliada e desfocada preenchendo o resto.
Use quando: o momento depende do cenário ou de três pessoas reagindo juntas. A gargalhada coletiva, alguém entrando no estúdio, um objeto sendo mostrado.
Cuidado com: usar como padrão. Os rostos ficam pequenos e o vídeo parece reaproveitado de horizontal, o que é exatamente o que ele é. Serve para dois ou três segundos, não para um minuto.
4. Plano de reação
Um ou dois segundos no rosto de quem ouve, no meio da fala de quem conta.
Use quando: a reação é o ponto do corte. A cara do convidado quando ouve a pergunta indiscreta. O apresentador segurando o riso.
Cuidado com: reação sem motivo. Se nada aconteceu no rosto de quem ouve, voltar para ele só quebra o ritmo.
Três pessoas: a regra muda
Com três pessoas, a tela dividida em três faixas quase nunca funciona no celular. Cada rosto fica pequeno demais e o olho não sabe para onde ir.
O que funciona melhor:
- Tela cheia em quem fala como base.
- Tela dividida em dois quando duas das três estão no embate e a terceira está só ouvindo.
- Vídeo inteiro só para o momento coletivo, e por poucos segundos.
Na prática, um corte de mesa com três pessoas é um corte de duas pessoas com uma terceira que aparece quando tem algo a dizer.
Onde vão rosto e legenda
Vertical tem regiões que a interface cobre. A Meta recomenda, para Reels, deixar 14% do topo, 35% da base e 6% de cada lado sem texto, logo ou elemento importante. A base é a pior parte: é onde ficam nome da conta, descrição e botões.
Traduzindo para podcast:
Em tela cheia: olhos de quem fala na altura do terço superior, e legenda logo abaixo do queixo, ainda acima da faixa dos 35% de baixo.
Em tela dividida: a legenda vai na emenda entre os dois rostos, perto do centro da tela. É o único lugar que não cobre ninguém e ainda fica fora da interface. Legenda embaixo do rosto de baixo cai em cima do nome da conta e da descrição.
No vídeo inteiro: a faixa com o quadro original fica no meio, e a legenda pode ir logo abaixo dela.
Uma dica que resolve muita coisa: legenda com cor diferente para cada pessoa. Em tela dividida, o espectador identifica quem está falando sem precisar procurar a boca que se mexe. O impacto do estilo da legenda na retenção está em legenda não é enfeite.
Os erros de troca que cansam
A troca de câmera é o que mais diferencia corte de podcast amador de profissional. Quatro erros comuns:
Trocar no meio da palavra. A troca tem que cair no começo da frase de quem assume a fala, não meio segundo antes nem no meio.
Trocar por som, não por fala. Risada, "uhum" e tosse não são troca de fala.
Trocar rápido demais. Duas trocas em menos de um segundo parecem erro de edição, mesmo quando a conversa foi rápida. Se a conversa é tão rápida assim, é caso de tela dividida.
Nunca trocar. O oposto também cansa: um minuto inteiro numa pessoa só, com a outra fazendo perguntas fora de quadro, deixa o espectador sem o rosto de metade da conversa.
O ritmo de corte em geral está em cortes secos e ritmo, e ele vale em dobro aqui.
Um roteiro de decisão para cada corte
Antes de enquadrar, responda três perguntas:
- Quantas pessoas são necessárias para entender o trecho? Uma: tela cheia. Duas ao mesmo tempo: tela dividida. O grupo: vídeo inteiro por pouco tempo.
- Tem reação que conta a história? Se sim, marque o segundo exato e insira o plano de reação.
- A primeira imagem tem rosto grande? Se o corte abre em tela dividida com rostos pequenos, considere abrir em tela cheia e dividir depois.
O corte bom de podcast quase sempre usa dois ou três enquadramentos em sequência, não um só.
Onde a ferramenta faz o trabalho chato
Fazer isso à mão significa marcar keyframe cada vez que a fala troca de dono. Num episódio de duas horas com vinte cortes, são centenas de keyframes.
No Cut.Pro, o reenquadramento vertical segue o rosto e a transcrição identifica quem está falando, então a troca de câmera acompanha a troca de fala sem você marcar nada. Nos templates do editor dá para escolher quais enquadramentos a IA pode usar (tela cheia em quem fala, tela dividida com duas pessoas, vídeo inteiro com fundo desfocado, entre outros) e ela escolhe entre os marcados conforme a cena de cada trecho. Você revisa e corrige a troca que ficou fora do lugar, que é bem mais rápido que fazer do zero.
Se você está escolhendo ferramenta para podcast, o comparativo está em melhor IA para cortes de podcast. E para a rotina de volume, como transformar um podcast em 20 cortes por semana.
Resumindo
- Podcast com várias pessoas não cabe inteiro no 9:16. A pergunta é quem precisa estar na tela agora.
- Tela cheia em quem fala é o padrão; tela dividida é para embate; vídeo inteiro é para o momento coletivo; plano de reação é para quando a cara conta a história.
- Com três pessoas, trate como duas mais uma que entra quando fala.
- Legenda em tela dividida vai na emenda entre os rostos. A Meta pede 14% do topo, 35% da base e 6% dos lados livres de texto nos Reels.
- Troque a câmera no começo da frase de quem assume a fala, nunca por interjeição.
O espectador não percebe enquadramento bom. Percebe o ruim, e vai embora antes de saber por quê.
Fontes: Meta, especificações de anúncio em Reels do Instagram (área segura)

