ElevenLabs ha lanzado una nueva página de síntesis de voz, que simplifica más que nunca la creación de voces de IA y su uso para la conversión de texto a voz.
La plataforma de voz de inteligencia artificial tiene las voces sintéticas y clones de voz con el sonido más natural de cualquiera de los servicios disponibles actualmente.
El nuevo motor de voz de OpenAI, que actualmente no está disponible para el público, podría competir por su dinero, pero OpenAI está retrasando su lanzamiento debido a preocupaciones de seguridad.
dando el Síntesis de voz de ElevenLabs página un nuevo diseño ha simplificado el proceso de creación, abriéndose con solo un cuadro de texto. Expone otros controles solo una vez que comienza a interactuar con la herramienta, lo que facilita el inicio.
Para tener una idea de qué tan bien funciona, creé algunos clips cortos usando las voces sintéticas incorporadas, así como una prueba de voz a voz usando mi propia voz clonada. El clon de mi voz se parece tanto a mí que resultaba inquietante.
¿Cómo se clona una voz con ElevenLabs?
Clonar una voz en ElevenLabs es rápido y sencillo. Hay dos formas de hacerlo, la más rápida es la clonación de voz instantánea, pero también puedes hacer una clonación profesional que lleva más tiempo pero produce una réplica más realista.
La clonación profesional requiere el mejor equipo posible y puede tardar hasta seis horas en recibir el clon final. Debe verificar su voz, verificar todo su equipo y proporcionar hasta tres horas de audio de muestra pidido en segmentos de 30 minutos con etiquetas.
Sin embargo, puede obtener una clonación notablemente precisa de su voz utilizando la clonación de voz instantánea, que requiere aproximadamente tres minutos de audio de muestra y está disponible en aproximadamente 20 minutos.
ElevenLabs dice que para la clonación instantánea solo necesitas hasta cinco minutos de audio, ya que todo lo anterior aporta poca mejora. También es importante utilizar audio grabado en un entorno con el mínimo ruido de fondo y con el mejor equipo posible.
Como esto podría usarse en cualquier voz, tener suficientes muestras de ElevenLabs te permite confirmar que tienes los derechos para usar esa voz con fines de clonación, pero por lo que pude ver, en realidad no verifica que ese sea realmente el caso.
Clonando mi propia voz con ElevenLabs

He probado un par de enfoques diferentes para clonar mi voz. En uno me grabé leyendo un libro en tres segmentos de un minuto, pero el clon sonaba forzado y antinatural. Luego lo intenté hablando al azar sobre cualquier cosa que se me ocurriera durante tres minutos y sonaba más natural.
También es importante utilizar etiquetas precisas y una buena descripción, ya que eso influye en el clon final. Esto incluye su acento, lugar de nacimiento, sexo y edad aproximada.
Este fue un momento preocupante ya que cualquier parte de esta información podría ser utilizada por malos actores para robar su identidad, y colocarla junto a un clon de su propia voz es un riesgo aún mayor. Sugiero mantenerlo vago, según la década o el condado. Esta es también una de las razones por las que OpenAI optó por retrasar el lanzamiento de Voice Engine.
Le puse a mi esposa un clip de audio de muestra hecho con mi clon de voz y, si bien ella podía decir que no era realmente yo cuando era texto a voz (diciendo que sonaba como si estuviera leyendo un guión), no pudo elegir lo real de la versión falsa cuando usé discurso a discurso.
Speech-to-speech es la herramienta contenedora de voz de ElevenLabs. Básicamente, toma cualquier audio de entrada, ya sea grabado en el cuadro recién diseñado o de un clip cargado, y lo recrea utilizando la voz sintética o clonada seleccionada.
¿Para qué se puede utilizar la clonación de voz?

Me sorprendió lo cerca que se parecía el clon de mi voz a mi voz real, especialmente cuando la usaba con voz a voz.
No fue tan preciso cuando lo intenté usando un breve clip de audio grabado por mi manager ya que tiene un acento diferente al mío, pero si alguien con un acento similar usara mi clon de voz, sonaría casi exactamente como yo.
Esta tecnología podría utilizarse para grabar radionovelas enteras con un solo actor, e incluso resucitar a artistas fallecidos hace mucho tiempo. Esto es algo que preocupaba a SAG-AFTRA y fue parte de la huelga el año pasado.
Un caso de uso positivo en el que pensé durante mi experimento es mejorar la calidad del audio. Me grabé diciendo una oración, luego usé voz a voz con mi propio clon de voz en esa misma oración y sonó exactamente como yo, pero como si lo hubiera grabado en un estudio.
¿Qué protecciones existen?
En el futuro, la conversión de texto a voz mejorará hasta tal punto que perderá los problemas del valle inquietante, sonará tan natural como alguien hablando de verdad y luego se convertirá en una preocupación. Sin embargo, incluso con el sistema de voz a voz, el riesgo de fraude de identidad es alto.
Existen ciertas restricciones en el sistema de ElevenLabs, incluido un clasificador que detecta si un clip fue generado por IA y una herramienta de protección para evitar la creación de funcionarios o candidatos electos.
OpenAI dijo que primero discutiría el “despliegue responsable de voces sintéticas” y el impacto que podrían tener en la sociedad antes de lanzar Voice Engine.
“Con base en estas conversaciones y los resultados de estas pruebas a pequeña escala, tomaremos una decisión más informada sobre si implementar esta tecnología a escala y cómo hacerlo”, escribió la compañía en una publicación de blog.
Cabe señalar que hay docenas de proyectos de conversión de texto a voz de código abierto que se acercan a la calidad de ElevenLabs en términos de precisión de clonación, por lo que puede que ya sea demasiado tarde para volver a guardar ese juguete en particular.
- El salto de IA ‘superinteligente’ de OpenAI casi provocó el colapso de la empresa: he aquí por qué
- OpenAI está pagando a investigadores para evitar que la IA superinteligente se vuelva deshonesta
- OpenAI está construyendo AI GPT-5 de próxima generación, y el CEO afirma que podría ser superinteligente