Fish Audio S2.1 Pro: voz IA 11x más barata que ElevenLabs

En pocas palabras: Fish Audio cerró en 2026 una ronda seed de USD 52 millones y lanzó S2.1 Pro, su modelo de texto a voz que clona una voz con 5 segundos de muestra, habla 83 idiomas y cuesta USD 15 por millón de caracteres, once veces menos que ElevenLabs.

Fish Audio cerró una ronda seed de USD 52 millones y lanzó Fish Audio S2.1 Pro, su modelo insignia de texto a voz que clona una voz con 5 segundos de muestra, habla 83 idiomas y cuesta 11 veces menos que ElevenLabs. La empresa llegó a USD 21 millones de ingresos recurrentes anuales y 8 millones de usuarios en apenas un año.

Fish Audio es una empresa de inteligencia artificial de voz fundada por Shijia Liao, exinvestigador de video en Nvidia, que nació como el proyecto open-source Fish Speech. Fish Audio S2.1 Pro es su modelo de texto a voz (TTS): genera audio en 83 idiomas, clona voces con 5 segundos de muestra y permite control emocional a nivel de palabra mediante más de 15.000 etiquetas en lenguaje natural, según el reporte de AlphaSignal (2026).

En 30 segundos

  • Ronda seed de USD 52 millones liderada por Coreline Ventures y Capital Today.
  • Precio de USD 15 por cada millón de caracteres, contra los USD 60 a 165 de ElevenLabs (hasta 11 veces más barato).
  • 83 idiomas y clonación en 5 segundos, con control de emoción e intención palabra por palabra.
  • 56,3 caracteres por segundo de throughput, más rápido que GPT-Realtime-2 y Gemini 3.1 Flash TTS.
  • Ya lo usan HeyGen, LiveKit, Retell y Sanas, con despliegues on-prem compatibles con HIPAA.

¿Por qué Fish Audio logró recaudar USD 52 millones en su ronda seed?

Fish Audio levantó USD 52 millones en una ronda seed liderada por Coreline Ventures y Capital Today, según el anuncio recogido por AlphaSignal (2026). El argumento para los inversores fue duro y concreto: la empresa llegó a USD 21 millones de ingresos recurrentes anuales y 8 millones de usuarios en apenas un año.

La historia de fondo es lo que engancha. Fish Audio empezó en el dormitorio de Shijia Liao, un exinvestigador de video de Nvidia, fan de los VTubers y del anime, que estaba harto de las voces sintéticas monótonas.

Arrancó entrenando modelos en una sola placa de video gamer (sí, una sola). Ese proyecto se volvió open-source con el nombre Fish Speech y juntó más de 31.000 estrellas en GitHub, uno de los proyectos de voz más populares de la plataforma. De ahí a los USD 52 millones hay un salto enorme, y explica por qué los fondos hicieron cola: no invirtieron en una promesa, invirtieron en algo que ya facturaba y tenía tracción real.

El diferencial contra ElevenLabs no es solo técnico. Es de precio. Cuando podés dar una calidad comparable a una fracción del costo, el mercado te empuja, y eso es exactamente lo que están viendo los números de adopción.

¿Cuáles son las características principales del modelo S2.1 Pro?

Fish Audio S2.1 Pro es un modelo de texto a voz que genera audio en 83 idiomas, clona una voz con 5 segundos de muestra y controla emoción e intención a nivel de palabra con más de 15.000 etiquetas en lenguaje natural. Es el modelo insignia que la empresa lanzó junto con la ronda, según el sitio oficial.

Lo que lo separa del resto:

  • Clonación express: con 5 segundos de audio ya tenés una voz personalizada. La fidelidad completa la logra con 15 segundos.
  • Control emocional granular: podés meter tags de emoción, descripción en lenguaje natural y hasta múltiples hablantes dentro de la misma transcripción.
  • Multilingüe de verdad: 83 idiomas, con testimonios de usuarios que armaron locuciones en japonés, francés y árabe con la misma voz clonada.
  • On-prem con HIPAA: despliegue en tu propia infraestructura, apuntando a salud y sectores regulados.
  • Baja latencia: pensado para agentes de voz conversacionales en tiempo real, no solo para locuciones grabadas.

Hay una frase en la web de Fish Audio que resume su apuesta: “Cinco segundos es fácil. Cinco minutos es la prueba”. Dicho de otro modo: cualquiera clona una voz para una demo corta, lo difícil es sostener naturalidad y expresividad a lo largo de una conversación entera. Ahí es donde dicen ganar. Lo explicamos a fondo en protección de datos empresariales.

¿Qué tan rápido es Fish Audio comparado con GPT-Realtime-2 y Gemini?

Fish Audio S2.1 Pro procesa 56,3 caracteres por segundo, más rápido que GPT-Realtime-2 y que Gemini 3.1 Flash TTS, según los benchmarks que acompañaron el lanzamiento. La empresa también afirma ser 2 veces más rápida que Cartesia a un sexto del costo de ElevenLabs.

¿Por qué importa la velocidad acá? Porque un agente de voz que tarda en responder se siente roto. En una locución para un video da lo mismo si el render tarda 3 o 5 segundos. Pero en una llamada de atención al cliente, cada milisegundo de latencia entre que el usuario termina de hablar y el bot arranca se nota, y arruina la sensación de conversación natural.

Ese throughput de 56,3 caracteres por segundo es el que habilita los casos de uso conversacionales en tiempo real. Sin esa velocidad, no importa qué tan lindo suene: no sirve para un agente en vivo.

¿Por qué Fish Audio es 11 veces más barato que ElevenLabs?

Fish Audio cobra USD 15 por cada millón de caracteres, mientras que ElevenLabs va de USD 60 a 165 por el mismo volumen, según la comparativa oficial de Fish Audio. En el peor caso para el otro proveedor, la diferencia llega a 11 veces.

Ponele que hoy gastás USD 1.000 por mes en generación de voz con el proveedor caro. Con el precio de Fish Audio, ese mismo volumen te sale cerca de USD 300. Para un equipo que hace locuciones a escala (doblaje, tutoriales, IVR), eso es la diferencia entre que el proyecto cierre o no cierre.

Ahora bien, barato no significa peor. En pruebas ciegas, Fish Audio se llevó el 67% de preferencia sobre los competidores líderes. Un usuario citado en la web dice que compararon Fish Audio directamente contra ElevenLabs y que Fish Audio “ganó con claridad en autenticidad de voz y matiz emocional”. Tomalo con pinzas (son testimonios curados por la propia empresa), pero el 67% del blind test es un número más difícil de maquillar. Tema relacionado: como otras plataformas de IA.

CaracterísticaFish Audio S2.1 ProElevenLabsOtros
Precio API (1M caracteres)USD 15USD 60 a 165Cartesia: 6x más caro que Fish
Velocidad (caracteres/seg)56,3No informadoGPT-Realtime-2 y Gemini 3.1 Flash TTS: más lentos que Fish
Clonación de voz5 segundos30+ segundos30+ segundos habitual
Idiomas83Menor coberturaGoogle Cloud TTS: amplia, sin clonación express
On-prem HIPAALimitadoDepende del proveedor
Preferencia en blind test67%RestoResto
fish audio s2.1 pro diagrama explicativo

¿Qué empresas ya usan Fish Audio en producción?

Fish Audio ya corre en producción en HeyGen, LiveKit, Retell y Sanas, según el anuncio de la ronda. Son clientes que apuntan a agentes de voz, avatares y comunicación en tiempo real, justo el terreno donde la baja latencia pesa más.

El pitch para estas empresas es una solución de agente de voz de punta a punta. No te venden solo el TTS suelto: te dan streaming en tiempo real, clonación instantánea y transcripción que acepta múltiples hablantes, tags de emoción y descripción en lenguaje natural. Todo en la misma tubería.

El agregado de despliegues on-prem compatibles con HIPAA es una señal clara de hacia dónde miran: salud, finanzas, cualquier sector donde los datos de voz no pueden salir del perímetro de la empresa. Ese guiño a lo regulado es lo que distingue a un juguete de una herramienta que un banco o una clínica pueden aprobar.

¿Cómo clonar una voz con Fish Audio en 5 segundos?

Para clonar una voz con Fish Audio subís una muestra de audio de 5 segundos, el modelo la entrena al instante y ya podés generar texto con esa voz personalizada. Para fidelidad completa, la empresa recomienda 15 segundos de muestra. Es el flujo que describe el sitio oficial.

El paso a paso, sin vueltas:

  1. Grabá o subí la muestra: 5 segundos alcanzan para una clonación básica, 15 para calidad de estudio.
  2. Entrenamiento instantáneo: no hay espera de horas ni cola de procesamiento; la voz queda lista al toque.
  3. Generá con control: escribís el texto y le sumás tags de emoción o descripciones en lenguaje natural para ajustar el tono.
  4. Integrá por API: Fish Audio lanzó S2.1 Pro de forma gratuita vía API, según el anuncio en su blog, así que podés probarlo sin costo antes de escalar.

La diferencia con las herramientas que piden 30 segundos o más de muestra es práctica: con 5 segundos, cualquier clip corto de un video o una nota de voz de WhatsApp te sirve de base. Menos fricción, más casos de uso.

¿Cuál es el roadmap de Fish Audio después del funding?

Con la plata fresca, Fish Audio planea dos cosas grandes: modelos speech-to-speech (voz a voz directa, sin pasar por texto) y voice-native LLMs, modelos de lenguaje que nacen pensados para voz. También va a expandir las capacidades on-prem con HIPAA, según el anuncio de la ronda. Relacionado: dentro del ecosistema de modelos IA.

El salto a speech-to-speech es el más interesante. Hoy el pipeline típico es: voz entra, se transcribe a texto, un modelo procesa, se sintetiza de vuelta a voz. Cada paso agrega latencia y pierde matices (el tono, la duda, la emoción de quien habla). Un modelo voz a voz directo se saltea esos intermediarios.

¿Van a cumplir el roadmap? Habría que ver. Prometer voice-native LLMs es fácil, entregarlos con la calidad que muestran en TTS es otra cosa. Pero viniendo de un equipo que pasó de una placa de video gamer a USD 21 millones de ARR en un año, el beneficio de la duda se lo ganaron.

Qué significa para empresas y equipos en Latinoamérica

Para un equipo en la región, el punto fuerte es el precio y el soporte multilingüe. Si estás armando un agente de voz para atención al cliente en español, o doblando contenido, la diferencia entre USD 15 y USD 165 por millón de caracteres decide si el proyecto es viable o queda en el cajón.

Si vas por el camino on-prem (por regulación de datos o por control), vas a necesitar infraestructura propia donde correr el modelo y la API que lo consume. Para alojar ese backend en Argentina, con datos que no cruzan la frontera, conviene mirar un proveedor local como donweb.com antes que armar todo en un cloud del hemisferio norte.

El caso de uso obvio: IVR y bots de voz en español rioplatense que no suenen a robot de los 2000. Con las emotion tags podés darle calidez a un cobro, urgencia a una alerta, paciencia a un soporte técnico. Eso, hoy, cambia la percepción del cliente.

Errores comunes al evaluar Fish Audio S2.1 Pro

  • Creer que 5 segundos de muestra dan la misma calidad que 15. La clonación express sirve para prototipar, pero la propia empresa recomienda 15 segundos para fidelidad de estudio. Si vas a producción con una voz de marca, usá la muestra larga.
  • Elegir solo por precio y olvidar la latencia. Un TTS baratísimo pero lento arruina un agente conversacional. Mirá el throughput (los 56,3 caracteres por segundo) tanto como el costo por millón de caracteres.
  • Ignorar las emotion tags. Mucha gente engancha el modelo, le tira texto plano y se queja de que “suena neutro”. El diferencial de S2.1 Pro está en el control palabra por palabra; si no lo usás, dejás la mitad del valor sobre la mesa.
  • Asumir que barato es sinónimo de peor. El 67% de preferencia en pruebas ciegas dice lo contrario. No descartes la opción económica sin escuchar las muestras vos mismo.

Preguntas Frecuentes

¿Qué es Fish Audio y por qué es importante?

Fish Audio es una empresa de inteligencia artificial de voz que llegó a 8 millones de usuarios y USD 21 millones de ingresos anuales en su primer año. Importa porque ofrece calidad de voz comparable a ElevenLabs a una fracción del costo, lo que abarata el acceso a síntesis de voz de alta calidad para empresas y desarrolladores. Complementá con frente a Google en soluciones IA.

¿Cuánto más barato es Fish Audio que ElevenLabs?

Fish Audio cobra USD 15 por millón de caracteres frente a los USD 60 a 165 de ElevenLabs, hasta 11 veces más barato en el peor caso.

¿En cuántos idiomas puede generar voz Fish Audio?

Fish Audio S2.1 Pro genera voz en 83 idiomas. Usuarios reportaron haber creado locuciones en japonés, francés y árabe con la misma voz clonada, manteniendo la expresividad entre idiomas.

¿Cómo uso Fish Audio para clonar una voz?

Subís una muestra de audio de 5 segundos, el modelo la entrena al instante y generás texto con esa voz. Para fidelidad de estudio, la empresa recomienda 15 segundos de muestra. Se integra por API, que Fish Audio lanzó de forma gratuita junto con S2.1 Pro.

¿Fish Audio S2.1 Pro es gratis?

Fish Audio lanzó S2.1 Pro gratis vía API para desarrolladores, según el anuncio en su blog. La plataforma es gratuita para empezar y ofrece opciones pagas para volúmenes mayores.

Conclusión

Lo que cambió es simple: apareció un competidor serio de ElevenLabs que da calidad comparable a un onceavo del precio, y encima ganó un blind test con 67% de preferencia. Con USD 52 millones en el banco y 8 millones de usuarios de respaldo, Fish Audio S2.1 Pro dejó de ser un proyecto de dormitorio para volverse una opción de producción.

Si estás pagando de más por síntesis de voz, o si un proyecto de agente conversacional no te cerraba por costos, este es el momento de probar. La API es gratis para empezar, la clonación tarda 5 segundos y soporta 83 idiomas. Escuchá las muestras vos mismo, medí la latencia en tu caso real y compará el costo por millón de caracteres. Los números, esta vez, juegan a favor.

Fuentes

Desplazarse hacia arriba