Podcast con dos o tres personas en vertical: los encuadres que retienen

Un podcast con más de una persona no cabe entero en un cuadro 9:16, y el error más común es intentar que quepa. Hay cuatro encuadres que funcionan, cada uno para un tipo de momento, y elegir entre ellos decide más retención que los subtítulos o el gancho.

Podcast con dos o tres personas en vertical: los encuadres que retienen

Podcast con dos o tres personas en vertical: los encuadres que retienen

El dato: un podcast grabado en 16:9 con dos personas una al lado de la otra no cabe en un cuadro 9:16 sin perder a alguien. Hay cuatro encuadres que lo resuelven: pantalla completa en quien habla, pantalla dividida, vídeo entero con fondo desenfocado y plano de reacción. Cada uno sirve para un tipo de tramo, y elegir mal cuesta más retención que cualquier subtítulo mal hecho.

El error más común no es elegir el encuadre equivocado. Es elegir uno solo y usarlo en todo el clip.

Por qué el podcast es el formato más difícil de pasar a vertical

El gameplay tiene webcam y pantalla, y la solución ya es estándar. El vlog se graba con una persona en el centro. El podcast es el peor caso: dos o tres personas repartidas en horizontal, cada una con un micrófono delante de la boca, y el contenido vive justo en el intercambio entre ellas.

Si recortas un cuadro 9:16 de un vídeo 16:9 a la misma altura, te queda más o menos un tercio del ancho original (608 de 1920 píxeles, en un vídeo 1080p). Encuadrar las dos caras a la vez sin dividir la pantalla casi siempre significa caras diminutas. Una cara pequeña en un feed vertical es la señal más rápida de "no vale la pena parar", el problema que tratamos en la tasa de salto.

La pregunta correcta no es "cómo meto a todos", sino "quién tiene que estar en pantalla en este segundo".

Los cuatro encuadres y cuándo usar cada uno

1. Pantalla completa en quien habla

El recorte cierra en la cara de quien habla y cambia cuando la palabra cambia de dueño.

Úsalo cuando: una persona cuenta una historia, explica una idea o da una opinión larga. Es el encuadre por defecto de la mayoría de los clips de podcast, porque la mayor parte de los buenos tramos tiene un protagonista.

Cuidado con: cambiar con cada "ajá", "sí", "madre mía". La interjección de quien escucha no es un cambio de turno.

2. Pantalla dividida

Una cara en cada mitad, apiladas: una arriba y otra abajo.

Úsala cuando: las dos personas participan del momento a la vez. Discusión con respuesta rápida, chiste con réplica, entrevista en la que la pregunta importa tanto como la respuesta.

Cuidado con: tramos largos de una sola persona. La mitad de quien calla se vuelve espacio muerto y la cara de quien habla se queda con la mitad del tamaño que podría tener.

3. Vídeo entero con fondo desenfocado

El cuadro original entero en una franja horizontal en el medio, con una copia ampliada y desenfocada rellenando el resto.

Úsalo cuando: el momento depende del escenario o de tres personas reaccionando juntas. La carcajada colectiva, alguien que entra al estudio, un objeto que se muestra.

Cuidado con: usarlo por defecto. Las caras quedan pequeñas y el vídeo parece reciclado del horizontal, que es exactamente lo que es. Sirve para dos o tres segundos, no para un minuto.

4. Plano de reacción

Uno o dos segundos en la cara de quien escucha, en medio de la historia del otro.

Úsalo cuando: la reacción es el punto del clip. La cara del invitado ante la pregunta indiscreta. El presentador aguantándose la risa.

Cuidado con: reacciones sin motivo. Si no pasó nada en la cara de quien escucha, volver a ella solo rompe el ritmo.

Tres personas: la regla cambia

Con tres personas, la pantalla dividida en tres franjas casi nunca funciona en el móvil. Cada cara queda demasiado pequeña y el ojo no sabe adónde ir.

Lo que funciona mejor:

  • Pantalla completa en quien habla como base.
  • Pantalla dividida en dos cuando dos de las tres están en el cruce y la tercera solo escucha.
  • Vídeo entero solo para el momento colectivo, y durante pocos segundos.

En la práctica, un clip de mesa con tres personas es un clip de dos personas con una tercera que aparece cuando tiene algo que decir.

Dónde van la cara y los subtítulos

El vertical tiene zonas que tapa la interfaz. Para Reels, Meta recomienda dejar el 14% superior, el 35% inferior y el 6% de cada lado sin texto, logos ni elementos importantes. La parte de abajo es la peor: ahí van el nombre de la cuenta, la descripción y los botones.

Aplicado al podcast:

En pantalla completa: los ojos de quien habla a la altura del tercio superior y los subtítulos justo debajo de la barbilla, todavía por encima del 35% inferior.

En pantalla dividida: los subtítulos van en la unión entre las dos caras, cerca del centro. Es el único lugar que no tapa a nadie y queda fuera de la interfaz. Los subtítulos debajo de la cara de abajo caen encima del nombre de la cuenta y la descripción.

En vídeo entero: la franja con el cuadro original va en el medio, y los subtítulos pueden ir justo debajo.

Un truco que arregla mucho: un color de subtítulo distinto para cada persona. En pantalla dividida, el espectador identifica quién habla sin buscar la boca que se mueve. El efecto del estilo de subtítulo en la retención está en estilo de subtítulos y retención.

Los errores de cambio de cámara que cansan

El cambio de cámara es lo que más separa un clip de podcast amateur de uno profesional. Cuatro errores comunes:

Cambiar a mitad de palabra. El cambio tiene que caer al inicio de la frase de quien toma la palabra, ni medio segundo antes ni en medio.

Cambiar por sonido y no por habla. Risas, "ajá" y tos no son cambio de turno.

Cambiar demasiado rápido. Dos cambios en menos de un segundo parecen un error de edición, aunque la conversación haya sido así de rápida. Si es tan rápida, es caso de pantalla dividida.

No cambiar nunca. Lo contrario también cansa: un minuto entero en una sola persona mientras la otra pregunta fuera de cuadro deja al espectador sin la cara de media conversación.

El ritmo de corte en general está en cortes secos y ritmo, y aquí cuenta el doble.

Una lista de decisión para cada clip

Antes de encuadrar, responde tres preguntas:

  1. ¿Cuántas personas hacen falta para entender el tramo? Una: pantalla completa. Dos a la vez: dividida. El grupo: vídeo entero, poco tiempo.
  2. ¿Hay una reacción que cuenta la historia? Si la hay, marca el segundo exacto e inserta el plano de reacción.
  3. ¿La primera imagen tiene una cara grande? Si el clip abre en pantalla dividida con caras pequeñas, plantéate abrir en pantalla completa y dividir después.

Un buen clip de podcast casi siempre usa dos o tres encuadres seguidos, no uno solo.

Dónde la herramienta hace la parte aburrida

Hacer esto a mano significa poner un keyframe cada vez que cambia quien habla. En un episodio de dos horas con veinte clips, son cientos de keyframes.

En Cut.Pro, el reencuadre vertical sigue la cara y la transcripción identifica quién está hablando, así que el cambio de cámara acompaña el cambio de turno sin que marques nada. En las plantillas del editor puedes elegir qué encuadres puede usar la IA (pantalla completa en quien habla, pantalla dividida con dos personas, vídeo entero con fondo desenfocado, entre otros) y ella elige entre los marcados según la escena de cada tramo. Tú revisas y corriges el cambio que quedó fuera de sitio, que es mucho más rápido que hacerlo desde cero.

Si estás eligiendo herramienta para podcast, la comparativa está en la mejor IA para clips de podcast. Y para el volumen, cómo convertir un podcast en clips cada semana.

Lo esencial

  • Un podcast con varias personas no cabe entero en 9:16. La pregunta es quién tiene que estar en pantalla ahora.
  • Pantalla completa en quien habla es lo normal; pantalla dividida es para el cruce; vídeo entero es para el momento de grupo; plano de reacción es para cuando una cara cuenta la historia.
  • Con tres personas, trátalo como dos más una que entra cuando habla.
  • En pantalla dividida, los subtítulos van en la unión entre las caras. Meta pide 14% arriba, 35% abajo y 6% a los lados sin texto en Reels.
  • Cambia al inicio de la frase de quien toma la palabra, nunca por una interjección.

El espectador no nota un buen encuadre. Nota el malo, y se va antes de saber por qué.

Fuentes: Meta, especificaciones de anuncios en Reels de Instagram (zona segura)

Compartir

Sigue leyendo

Más insights y tutoriales para crecer como creador de contenido.