Guía de implementación de TTS Studio: 322 voces de IA compatibles con 75 idiomas

TTS Studio es una herramienta de texto a voz de código abierto, que cuenta con 322 voces de IA y soporta 75 idiomas, diseñada para convertir archivos de subtítulos (SRT / VTT) o texto plano en audio multilingüe, ideal para creadores de contenido que necesitan producir doblajes en varios idiomas. Se puede desplegar con Docker en aproximadamente diez minutos, y puede funcionar en un VPS, NAS o en una computadora personal, es gratuito, sin tarifas mensuales ni costos por llamadas a la API.

¿Qué es TTS Studio?

TTS Studio es una herramienta de conversión de texto a voz (Text-to-Speech) de código abierto, cuyo principal uso es convertir archivos de subtítulos (en formato SRT o VTT) o texto ingresado directamente en archivos de audio natural (MP3) mediante IA. Para los creadores de videos y podcasts que producen versiones multilingües, puede ahorrar una gran cantidad de tiempo en grabaciones frase por frase.

La herramienta incluye 322 voces, cubriendo 75 idiomas, incluyendo chino (mandarín / cantonés / taiwanés y varios acentos), inglés (americano / británico / australiano, etc.), japonés, coreano, francés, alemán, español, entre otros. Los usuarios pueden ingresar texto directamente en la interfaz web para escuchar una vista previa, y ajustar la velocidad y el volumen, logrando calidad de producción lista para publicar.

La herramienta también soporta la alineación automática de los tiempos — integrando directamente los códigos de tiempo de los subtítulos en el audio generado, coincidiendo en longitud con el original, sin necesidad de alineación manual. Además, incluye funciones útiles como autenticación de usuarios, historial de generación, y cambio entre temas claros y oscuros.

322 voces + 75 idiomas: ¿qué tipo de contenido es más adecuado?

La biblioteca de 322 voces de TTS Studio no está distribuida de manera uniforme — los idiomas más populares (inglés, japonés, coreano, francés, alemán, español) tienen decenas de opciones de voces masculinas, femeninas, infantiles y estilos especiales, mientras que los idiomas menos comunes (como el cantonés, árabe, vietnamita, etc.) tienen al menos 3-5 voces disponibles.

Los escenarios de aplicación incluyen:

  • Videos educativos multilingües: canales de enseñanza originalmente en mandarín o inglés pueden usar la herramienta para generar en masa doblajes en japonés, coreano, tailandés, combinando con la función de múltiples pistas de audio.
  • Podcast multilingüe: un podcast en cantonés que desea ofrecer una versión en inglés para oyentes en el extranjero puede utilizar voces en inglés.
  • Contenido de aprendizaje electrónico: escuelas o instituciones de formación pueden generar en masa materiales educativos en varios idiomas.
  • Doblaje de demostraciones de productos: empresas SaaS que necesitan generar rápidamente demostraciones de productos en varios idiomas.
  • Automatización de YouTube Shorts: generar en masa doblajes para videos cortos.

Limitaciones de la herramienta: aunque las voces generadas son naturales, puede que no reproduzcan al 100% el tono de marcas específicas (por ejemplo, imitar el estilo característico de un KOL); el doblaje comercial de marcas a menudo requiere ajustes manuales. Sin embargo, para la creación de contenido general o versiones iniciales multilingües, es más que suficiente.

Preparativos para el despliegue de Docker: requisitos de hardware + software

TTS Studio ofrece imágenes de Docker para arquitecturas arm64 y x86, lo que significa que casi todas las plataformas que pueden ejecutar Docker, como Windows, Mac (Intel o Apple Silicon), Linux VPS, NAS (Synology / QNAP), pueden desplegarlo.

Requisitos mínimos del sistema:

  • Procesador: 1 núcleo es suficiente (la síntesis se realiza principalmente en GPU o API en la nube, no se requiere cálculo local).
  • Memoria: se recomienda más de 1 GB.
  • Espacio en disco: 500 MB (imagen de Docker).
  • Red: el primer despliegue requiere descargar la imagen y los archivos de modelo TTS, alrededor de 200-500 MB.
  • Sistema operativo: Linux / macOS / Windows 10+ (soporta Docker Desktop / OrbStack / Rancher Desktop).

Si se despliega en un VPS en la nube, una especificación de entrada de 1 GB de RAM y 1 vCPU es suficiente. Si se desea ejecutar en una computadora local, un Mac con Apple Silicon será más eficiente (la imagen arm64 es compatible de forma nativa), mientras que un Mac Intel o una máquina con Windows utilizarán la imagen x86.

Despliegue con Docker Compose en un clic

El docker-compose.yml proporcionado por la oficial es bastante simple, todo el despliegue requiere solo un servicio:

“`yaml
version: ‘3’
services:
tts-studio:
image: ywsj/tts-studio:latest
container_name: tts-studio
ports:
– “5100:5100”
environment:
– ADMIN_USERNAME=admin
– ADMIN_PASSWORD=admin123
restart: unless-stopped
“`

Configuraciones clave:

  • Puerto 5100: se puede cambiar a cualquier puerto que prefieras, recuerda sincronizar el cambio en el host y el contenedor.
  • Cuenta predeterminada admin / contraseña admin123: después de completar el despliegue, es necesario cambiar la contraseña de inmediato (ya sea mediante variables de entorno o en la configuración de la interfaz web).
  • restart: unless-stopped: el servicio se reinicia automáticamente después de reiniciar el VPS.

Pasos de despliegue (Linux / Mac / WSL):

“`bash
# 1. Crear un directorio de trabajo
mkdir -p ~/tts-studio && cd ~/tts-studio

# 2. Crear docker-compose.yml (usando el contenido yaml anterior)
# nano o vim son opciones

# 3. Iniciar el contenedor
docker compose up -d

# 4. Ver el estado
docker compose ps
“`

Una vez que se inicie correctamente, ingresa la IP del VPS seguida del puerto (por defecto 5100) en el navegador para ver la interfaz de inicio de sesión. ⚠️ **Recuerda abrir las reglas del firewall correspondientes para el puerto en el panel de control de la nube** (por ejemplo, AWS Security Group, Cloudflare Tunnel, nginx reverse proxy, etc.), de lo contrario, no podrás acceder desde redes externas.

Guía de uso: Generar voz multilingüe por primera vez

La interfaz web después de iniciar sesión se divide en tres pasos:

**Primer paso: subir subtítulos o ingresar texto**

La herramienta soporta la carga directa de archivos de subtítulos SRT o VTT, o la entrada de texto plano en el cuadro de texto. Si subes un archivo de subtítulos, el audio generado se alineará automáticamente en longitud con la línea de tiempo, facilitando la edición y sincronización posterior.

**Segundo paso: seleccionar idioma y voz**

El menú de idiomas lista los 75 idiomas soportados, cada uno con varias opciones de voces. Las etiquetas de voz generalmente indican género, edad y estilo (por ejemplo, «voz masculina – serena», «voz femenina – alegre», «voz infantil», etc.). Después de seleccionar, puedes escuchar una vista previa de inmediato para confirmar que la voz, la velocidad (lenta / normal / rápida) y el volumen sean satisfactorios antes de generar oficialmente.

**Tercer paso: generar y descargar MP3**

Al hacer clic en «Iniciar generación», el motor TTS comenzará a sintetizar el audio en segundo plano. El tiempo de generación depende de la longitud del texto y la complejidad de la voz, generalmente un doblaje de 1-3 minutos requiere entre 30 segundos y 2 minutos para la síntesis. Una vez completado, puedes escuchar y descargar el MP3 de inmediato en la interfaz web.

Mejores prácticas después de familiarizarse: flujo de trabajo de múltiples pistas de audio para videos

Si tu objetivo final es subir a YouTube con la función de múltiples pistas de audio (Multi-language audio tracks), aquí tienes un flujo de trabajo completo:

1. En la pestaña «Subtítulos» del panel de YouTube, los subtítulos originales están configurados en el idioma principal. Haz clic en «Agregar idioma» y selecciona el idioma objetivo (por ejemplo, japonés, coreano), luego sube el archivo de subtítulos correspondiente.

2. En la pestaña «Audio», sube los archivos de audio correspondientes para cada idioma. Los MP3 generados por TTS Studio ya están alineados automáticamente en la línea de tiempo, simplemente súbelos.

3. Configura la «pista de audio predeterminada» como la versión en tu idioma principal. Los demás idiomas estarán disponibles para que los espectadores seleccionen y cambien en la configuración del reproductor de video.

⚠️ **Nota**: La función de múltiples pistas de audio de YouTube requiere que el video pase por la revisión antes de ser habilitada, generalmente se mostrará automáticamente dentro de 24-48 horas después de la publicación. Si no estás seguro de si tu video tiene esta función, puedes verificar en la pestaña «Subtítulos» del panel de YouTube si aparece el botón «Agregar idioma».

Consideraciones + limitaciones

**Las voces TTS son naturales, pero no pueden replicar al 100% el tono de marcas específicas.** Si los espectadores están muy familiarizados con la voz de un KOL, marca o personaje en particular, aunque la voz generada por TTS sea natural, generalmente será reconocida como generada por IA. El doblaje comercial de marcas a menudo requiere ajustes manuales o mezcla.

**La traducción de subtítulos requiere herramientas adicionales.** TTS Studio solo se encarga de la síntesis de voz, no de la traducción. Si tu idioma de origen es el chino pero deseas una versión en inglés del doblaje, primero necesitarás traducir los subtítulos con otras herramientas (como Google Translate, DeepL, ChatGPT, Claude) antes de usar TTS Studio para generar el doblaje en inglés.

**El primer despliegue requiere descargar archivos de modelo de 200-500 MB.** Dependiendo de la velocidad de la red del VPS, esto puede tardar entre 5 y 15 minutos. Después, se utilizará directamente el modelo local, sin necesidad de descargar nuevamente.

**La cuenta predeterminada admin / admin123 debe ser cambiada de inmediato.** Las credenciales de inicio de sesión predeterminadas de la herramienta son información pública, cualquier persona que conozca la IP y el puerto del VPS puede iniciar sesión. La primera acción después del despliegue debe ser cambiar la contraseña, o agregar una capa de autenticación mediante Cloudflare Access, Tailscale, etc.

Conclusión: ¿quién se beneficia más de esta herramienta de doblaje multilingüe?

TTS Studio es fácil de desplegar con Docker, cuenta con 322 voces y soporta 75 idiomas, además de funciones útiles como alineación automática de subtítulos, autenticación de usuarios y cambio de temas claros y oscuros, lo que lo convierte en una opción de alto costo-beneficio para creadores que desean producir contenido en múltiples idiomas.

**Usuarios más adecuados:**

  • Creadores de YouTube que desean lanzar un canal multilingüe.
  • Instituciones educativas / de formación que necesitan generar materiales en varios idiomas en masa.
  • Empresas SaaS que necesitan crear rápidamente demostraciones de productos en varios idiomas.
  • Presentadores de podcasts que desean expandir su programa de un solo idioma a una audiencia multilingüe.
  • Pequeñas y medianas empresas que desean crear videos de atención al cliente / educativos o podcasts en varios idiomas, pero con un presupuesto limitado.

**Usuarios menos adecuados:**

  • Producción de doblajes comerciales que requieren imitar al 100% la voz de un KOL / marca específica.
  • Necesidad de soporte para idiomas no convencionales (como lenguas de minorías, dialectos, etc.).
  • Usuarios sin antecedentes en IT (el despliegue de Docker tiene una curva de aprendizaje para principiantes).

Si tu situación de uso se ajusta a cualquiera de los puntos anteriores, vale la pena dedicar una hora a desplegar y probar TTS Studio. En comparación con las tarifas mensuales de las API comerciales de TTS (varios dólares por mil palabras), el costo de autoconstrucción es solo el costo mensual de un VPS (alrededor de USD $5 como mínimo).


Contenido original
Este artículo es la versión en español de un contenido original de TechRitual.
Stein Yep
Stein Yep