AiSrt: Traduce, Extrae y Transcribe tus Subtítulos gracias a la Inteligencia Artificial
Una herramienta gratuita para hacer accesibles los vídeos en 29 idiomas, para las personas sordas, con problemas de audición y todos los apasionados por el contenido multilingüe
¿Tienes un vídeo con subtítulos en inglés y los querrías en francés, en español, en árabe o en japonés? ¿O una película sin el menor subtítulo, de la que te gustaría sacar un .srt? Para eso exactamente escribí AiSrt.
AiSrt es una herramienta de línea de comandos que se apoya en la IA para traducir tus archivos de subtítulos .srt, extraer las pistas ya integradas en tus archivos de vídeo, y transcribir el audio de un vídeo directamente en subtítulos. Las tres en el mismo binario.
Para la traducción, puedes elegir entre cinco motores. Las API de OpenAI, de Anthropic (Claude), de Google (Gemini) y de xAI (Grok) cuestan unos céntimos por película. O también un servidor Ollama que funciona en tu propia máquina: gratis, sin conexión, sin ninguna clave, sin ninguna cuenta. Tus subtítulos no salen de tu disco duro.
Y si el vídeo no contiene ningún subtítulo, AiSrt recurre a Whisper, el modelo de reconocimiento de voz de OpenAI, que transforma la pista de audio en .srt él solo. Sinceramente, la primera vez que vi una conferencia de una hora salir subtitulada sin que yo escribiera una sola línea, me produjo algo.
Novedad de esta versión: los subtítulos de Blu-ray, que no son texto sino imágenes, ahora también se pueden leer. AiSrt los decodifica, los pasa por un motor de reconocimiento de caracteres, y después hace que la IA revise el resultado. Retomo el tema más abajo, es la parte de la que estoy más contento.
¿Por qué AiSrt?
- La accesibilidad, lo primero. Las personas sordas y con problemas de audición merecen un acceso sencillo a los contenidos de vídeo. Generar y traducir subtítulos debería llevar unos minutos, no una tarde entera.
- 29 idiomas. Árabe, alemán, inglés, chino, coreano, danés, español, finés, francés, griego, hindi, hebreo, húngaro, indonesio, italiano, japonés, malayo, neerlandés, noruego, polaco, portugués, rumano, ruso, sueco, checo, tailandés, turco, ucraniano y vietnamita.
- Una traducción que entiende el contexto. Esa es toda la diferencia con un traductor palabra por palabra: las expresiones idiomáticas, el humor y los juegos de palabras pasan mucho mejor.
- Tres funciones en una sola herramienta: traducción, extracción, transcripción.
- Incluso los subtítulos que son imágenes. Las pistas PGS de los Blu-ray se leen mediante reconocimiento de caracteres, y después la IA las revisa para corregir lo que el OCR ha visto mal.
- Cinco motores de traducción para elegir. OpenAI, Claude, Gemini, Grok u Ollama, con tu propia clave, cambiable con una opción.
- Gratis y sin conexión si quieres. Con Ollama instalado en tu máquina, la traducción no cuesta nada, no pide ninguna clave y no envía nada a ninguna parte. Práctico para contenido que no quieres hacer pasar por un servicio de terceros.
- Nada que instalar aparte. El binario es autónomo, no hay ningún runtime de .NET que descargar, está todo dentro. Y ffmpeg y whisper.cpp se descargan automáticamente en Windows y Linux cuando hacen falta.
- Aceleración NVIDIA en Windows. Si AiSrt detecta tu tarjeta gráfica, cambia a la versión CUDA de whisper y la transcripción va bastante más rápido.
Instalación
Requisitos previos
Nada obligatorio, la verdad. La extracción y la transcripción funcionan sin clave, sin cuenta y sin enviar nada a ninguna parte.
Para la traducción, necesitas una clave de uno de los cuatro servicios de pago (OpenAI, Anthropic, Google o xAI), u Ollama instalado en tu máquina, que es gratuito y funciona sin conexión. Las dos secciones siguientes explican uno y otro, elige la que te venga bien.
Solo hay un caso que requiere una herramienta adicional: los subtítulos que son imágenes. En ese caso necesitas Tesseract, que instalas tú mismo. Un comando, y queda resuelto para siempre.
No hay ningún runtime que instalar: cada archivo contiene un ejecutable autónomo para tu sistema.
- Descarga abajo el archivo que corresponde a tu máquina: Windows x64, Linux x64, o macOS (Apple Silicon M1 a M4, o Intel x64).
- Descomprímelo en la carpeta que quieras.
- Opcional: añade esta carpeta a tu variable de entorno
PATH para llamar a aisrt desde cualquier terminal.
En macOS, si el sistema se niega a ejecutar el binario, abre el Terminal en la carpeta y ejecuta chmod +x aisrt, y después xattr -cr aisrt. Las builds de macOS están firmadas y notarizadas, así que en principio no deberías necesitarlo.
Una clave API, en el servicio que quieras
Una vez más: es únicamente para la traducción.
- Ve a platform.openai.com y crea una cuenta, o inicia sesión.
- Ve a API Keys desde el menú de tu perfil, arriba a la derecha.
- Haz clic en Create new secret key.
- Ponle un nombre, AiSrt por ejemplo, y valida.
- Copia la clave inmediatamente, no volverá a mostrarse.
- Pégala en
appsettings.json, en lugar de "OPENAI_KEY" :
{
"OpenAI": {
"ApiKey": "sk-votre-cle-api-ici",
"Model": "gpt-5-mini",
"Temperature": 1
}
}
Este archivo se encuentra junto al ejecutable. Una vez instalado AiSrt, se lee desde %LOCALAPPDATA%\AiSrt\appsettings.json en Windows, y desde ~/.config/aisrt/appsettings.json en Linux y macOS.
Consejo: también puedes guardar la clave en un archivo .env aparte. Pon "UseSecretEnvFile": true en appsettings.json, indica la ruta del archivo, y escribe dentro la línea OPENAI_KEY=sk-votre-cle-api-ici. Es lo que hago en casa, así evito ir llevando la clave de un lado a otro en un archivo de configuración que compartimos sin pensarlo demasiado.
El coste: OpenAI cobra según el uso, y un subtítulo consume muy poco. Calcula unos céntimos para una película entera con gpt-5-mini.
Y si prefieres Claude, Gemini o Grok
Desde esta versión, OpenAI ya no es el único servicio de pago. Otros tres hacen exactamente el mismo trabajo, con tu propia clave: Anthropic para Claude, Google AI Studio para Gemini, y xAI para Grok. El proceso es el mismo en todas partes: creas una cuenta, generas una clave, la pegas en appsettings.json.
Cada servicio tiene su propia sección, con su modelo predeterminado ya rellenado:
{
"Translation": { "Provider": "anthropic" },
"Anthropic": { "ApiKey": "sk-ant-votre-cle", "Model": "claude-haiku-4-5" },
"Gemini": { "ApiKey": "votre-cle", "Model": "gemini-3.6-flash" },
"Xai": { "ApiKey": "xai-votre-cle", "Model": "grok-4.5" }
}
Y para probar un servicio sin tocar el archivo, está la opción --provider:
aisrt "film.srt" -t fr --provider anthropic
aisrt "film.srt" -t fr --provider gemini
aisrt "film.srt" -t fr --provider grok
Los nombres habituales son válidos, así que claude, google, grok y gpt funcionan igual de bien que los nombres oficiales. Los añadí porque yo mismo me equivocaba una de cada dos veces.
Un detalle que me costó una noche: cada servicio acepta dos nombres de variable de entorno para su clave, por ejemplo ANTHROPIC_API_KEY o CLAUDE_API_KEY. Había rellenado mi archivo .env con el nombre del modelo y no con el de la empresa, y AiSrt me explicaba educadamente que faltaba mi clave. Estaba allí, bajo un nombre que no miraba.
Una última cosa, y sirve para los cuatro: si la clave es falsa, si la cuenta está vacía o si el modelo no existe, AiSrt lo dice antes de empezar, indicando la línea del archivo de configuración que hay que corregir. Se acabaron los bloqueos a mitad de una película medio traducida.
O si no: traducir gratis, en casa, con Ollama
¿No te apetece crear una cuenta de OpenAI, o no quieres que tus archivos vayan a un tercero? Instala Ollama, que ejecuta un modelo de lenguaje directamente en tu máquina. Es gratis, ilimitado, y funciona sin conexión a internet una vez descargado el modelo.
Tres pasos:
# 1. Installer Ollama depuis ollama.com, puis demarrer le serveur
ollama serve
# 2. Telecharger le modele livre par defaut
ollama pull gpt-oss:20b
# 3. Traduire, en local
aisrt "film.srt" -t fr --provider ollama
La opción --provider se aplica al comando en curso. Si quieres que Ollama se convierta en tu motor predeterminado, pon "Provider": "ollama" en la sección Translation de appsettings.json, y ya no tendrás que pensar en ello.
¿Qué modelo elegir? He probado varios y la respuesta me sorprendió. Un modelo local debe respetar un formato de salida muy estricto, un bloque traducido por cada bloque enviado, en orden, sin comentarios. Algunos no lo consiguen en absoluto: qwen2.5 me coló comentarios en chino en medio de los subtítulos, tres veces de tres, incluso limitándolo al máximo. No se puede usar. llama3.1:8b lo hace muy bien y va aproximadamente diez veces más rápido. gpt-oss:20b es el que incluyo por defecto, porque no perdió ni un solo bloque durante mis pruebas, pero es bastante más pesado (aproximadamente 14 GB) y más lento.
Seamos sinceros con el compromiso: en local, es gratis pero lento, y la calidad sigue estando por debajo de lo que produce gpt-5-mini. Para una película que vas a ver esta noche, la API de OpenAI de tres céntimos es más cómoda. Para procesar una temporada entera sin mirar el contador, o para contenido sensible, Ollama resulta interesante.
Una cosa que me hizo perder tiempo y que te ahorro: AiSrt habla con Ollama mediante su API nativa y le impone una ventana de contexto suficiente. Si se pasa por la capa de compatibilidad OpenAI de Ollama, este ajuste se ignora, el modelo trunca su respuesta sin decirlo, y acabas con bloques que faltan en el archivo final. Está gestionado por ti, pero eso explica por qué los lotes son más pequeños en local (10 bloques en lugar de 40).
Lo que pasa antes de que se ponga en marcha
Al iniciarse se ejecutan dos comprobaciones, y me han ahorrado unos cuantos enfados.
La primera mira el archivo que le das. Si escribes aisrt film.mkv olvidando la opción, AiSrt te responde que es un vídeo y te indica --extract o --transcribe. Antes, leía el archivo binario como texto y lo enviaba tal cual a la IA, que respondía con un error incomprensible sobre el tamaño de la solicitud. Por cierto, si le das un subtítulo que no es .srt (un .ass, un .vtt, un .sub), lo convierte él solo con ffmpeg y sigue con la traducción.
La segunda comprueba que el motor de traducción responde, antes de enviar nada. Clave no válida, cuenta sin crédito, servidor Ollama no iniciado, modelo no descargado: cada caso tiene su mensaje y su comando de reparación. No hay nada peor que iniciar la extracción de seis pistas, irse a tomar un café y encontrarse seis errores idénticos al volver.
Guía de uso
Sintaxis general
aisrt [<fichier>] [options]
Todas las opciones
| Opción | Descripción | Valor predeterminado |
|---|
<file> | Ruta al archivo .srt que traducir, o al archivo de vídeo con --extract y --transcribe | ninguna |
-t, --target <code> | Código del idioma de destino | fr |
-s, --source <code> | Código del idioma de origen | en |
--languages | Muestra los 29 idiomas y sus códigos | ninguna |
--streams | Enumera las pistas de subtítulos de un vídeo, sin extraer nada | ninguna |
--extract | Extrae las pistas de subtítulos de un vídeo, mediante una selección interactiva. Las pistas de imagen se leen mediante OCR | ninguna |
--transcribe | Transcribe el audio de un vídeo a .srt con whisper.cpp | ninguna |
-p, --provider <nom> | Motor de traducción: openai, anthropic, gemini, xai u ollama | el de appsettings.json |
--stream <n|all> | Con --extract: la pista que extraer, sin pasar por el menú | ninguna |
-tt, --translate-to <code> | Con --extract o --transcribe: traduce el resultado sin preguntar nada | ninguna |
-m, --model <nom> | Con --transcribe: el modelo de whisper, sin pasar por el menú | ninguna |
-al, --audio-language <code> | Con --transcribe: el idioma hablado en el vídeo | detectado por whisper |
-ni, --non-interactive | No hace ninguna pregunta, aplica los valores predeterminados | ninguna |
--version | Muestra la versión | ninguna |
-h, --help | Muestra la ayuda | ninguna |
Ojo con no confundir --streams en plural, que se limita a listar las pistas, y --stream en singular, que elige una para extraer. Una letra de diferencia, dos efectos muy distintos. Dudé en renombrarlos, y luego no: los dos nombres son los que salen de forma natural.
1. Traducir subtítulos
La función principal, y la que más uso:
# Traduire de l'anglais vers le français (comportement par défaut)
aisrt "film.srt"
# Traduire de l'anglais vers l'espagnol
aisrt "film.srt" -s en -t es
# Traduire du français vers le japonais
aisrt "film.fr.srt" -s fr -t ja
El archivo traducido incluye el código del idioma de destino en su nombre: film.fr.srt, film.es.srt, y así sucesivamente. El archivo de salida anterior, si ya existe, se copia como .bak.srt antes de sobrescribirlo.
La traducción se hace por lotes de 40 bloques, y cada lote se escribe en el disco en cuanto vuelve. Así es como queda en mi caso con una película completa:

598 bloques divididos en 15 lotes, y ves cómo el tiempo se acumula a la derecha: aproximadamente un minuto por lote, algo menos de quince minutos para la película entera. Si se corta en el lote 13, volver a ejecutar el mismo comando continúa desde el lote 13.
2. Listar las pistas de un vídeo
Antes de extraer, podemos mirar qué hay en el archivo:
aisrt --streams "film.mkv"
Obtienes una tabla con el número de flujo, el idioma, el códec y el tipo de cada pista, texto o bitmap.
3. Extraer los subtítulos de un vídeo
Muchos MKV y MP4 ya llevan subtítulos incorporados. Mejor recuperarlos que volver a fabricarlos:
aisrt --extract "film.mkv"
Un menú te deja elegir una pista, o extraerlas todas de una vez. Se admiten los formatos de texto (SRT, ASS, SSA, WebVTT, mov_text). Las pistas PGS, las de los Blu-ray, son imágenes: ahora se leen mediante reconocimiento de caracteres, y la sección siguiente está dedicada a ellas. Las de los DVD y la TDT todavía no se descodifican, pero AiSrt te lo dice claramente en lugar de saltárselas en silencio. Una vez terminada la extracción, propone traducir cada pista de inmediato, con el idioma de la pista como idioma de partida.
Nota: ffmpeg se descarga automáticamente en Windows y Linux si todavía no está en tu máquina. En macOS, instálalo con brew install ffmpeg.
4. Transcribir el audio en subtítulos
¿No hay subtítulos en absoluto en el vídeo? Los fabricamos, con whisper.cpp:
aisrt --transcribe "film.mkv"
En el primer lanzamiento, AiSrt te pregunta qué modelo de reconocimiento de voz quieres utilizar:
- base.en, unos 150 MB: rápido, correcto con un inglés bien articulado
- small.en, unos 500 MB: el buen compromiso
- medium.en, unos 1,5 GB: más preciso, más lento
- base, small, medium: los mismos tamaños, pero multilingües
- large-v3, unos 3 GB: el más preciso, multilingüe y el más lento
Puedes saltarte este menú con --model si ya sabes lo que quieres.
Transcribir algo que no sea inglés
Antes, AiSrt daba por hecho que le dabas inglés. Era una idea muy mala: un discurso en francés salía convertido en subtítulos en inglés aproximados, sin una sola palabra de advertencia, y si después encadenabas una traducción, obtenías francés retraducido desde ese inglés. Un teléfono roto con tus propios vídeos.
Ahora, whisper detecta el idioma hablado y AiSrt lee su respuesta sobre la marcha. No tienes que declarar nada, y el archivo producido lleva el código de idioma correcto. Siempre puedes imponerlo si sabes lo que haces, con un modelo multilingüe:
aisrt --transcribe "film.mkv" --audio-language fr --model base
El archivo producido se llama entonces film.fr.srt, y si después encadenas una traducción, AiSrt sabe que el punto de partida es el francés.
Una trampa en la que estuve trabajando un rato: los modelos cuyo nombre termina en .en están entrenados únicamente con inglés. Dales audio en francés y no protestan, te devuelven fonética inglesa con todo el aplomo del mundo. Es el tipo de resultado que solo detectas al leer el archivo. Por eso AiSrt rechaza la combinación antes de lanzar nada y te da la lista de modelos adecuados.
En Windows y Linux, AiSrt descarga whisper él solo. En Windows, además detecta una tarjeta NVIDIA y utiliza la versión CUDA, mucho más rápida.
En macOS, hay que dar un paso más. El proyecto whisper.cpp no publica allí un ejecutable de línea de comandos, solo un framework destinado a los desarrolladores de Apple: por tanto, no hay nada que descargar automáticamente. La solución cabe en un comando:
brew install whisper-cpp ffmpeg
AiSrt buscará entonces las herramientas instaladas en tu sistema y las utilizará tal cual. No tengo un Mac a mano para llevar a cabo este escenario de principio a fin, así que si estás en macOS y algo se atasca, escríbeme, me interesa.
Los subtítulos que son imágenes
Saca una pista de subtítulos de un Blu-ray y no obtendrás texto. Obtendrás imágenes, una por réplica, en un formato que se llama PGS. El disco no almacena las palabras, almacena la foto de las palabras. Es práctico para conservar la fuente y la colocación exactas del cine, es catastrófico en cuanto quieres traducir: no hay nada que traducir, solo hay píxeles.
Hasta ahora, AiSrt te decía educadamente que no sabía hacerlo. Ahora sí sabe.
Qué ocurre cuando lanzas el comando
No hay nada nuevo que escribir, es el mismo comando de antes:
aisrt --extract "film.mkv"
Si eliges una pista de imagen, AiSrt encadena tres pasos. Saca la pista en bruto del contenedor con ffmpeg. Decodifica las imágenes él mismo, una por subtítulo, recuperando de paso los instantes de visualización tal como los escribió el disco. Luego se lo pasa todo a Tesseract, un motor de reconocimiento de caracteres (un software que relee texto en una imagen), de una sola vez para toda la pista.
El archivo de idioma de Tesseract se descarga solo, en el idioma que declara la pista. Una pista francesa recupera el francés, una pista japonesa el japonés. No tienes que elegir nada.
Tesseract, hay que instalarlo a mano
Es la única dependencia que AiSrt no va a buscar por ti, y es algo deliberado. ffmpeg y whisper publican ejecutables autónomos que puedo descargar limpiamente. Tesseract, no: son instaladores del sistema, diferentes en cada plataforma. Basta con un comando:
# Windows
winget install tesseract-ocr.tesseract
# Linux
sudo apt install tesseract-ocr
# macOS
brew install tesseract
Una pequeña anécdota que me hizo perder media hora: en Windows, este instalador no mete Tesseract en el PATH. Así que AiSrt me respondía que no encontraba la herramienta, y me proponía ejecutar exactamente el comando que acababa de ejecutar. Un bucle sin salida. AiSrt ahora va a mirar en las carpetas donde el instalador deposita realmente el binario.
La IA relee lo que ha leído el OCR
Un motor de reconocimiento de caracteres siempre comete los mismos errores. La barra vertical en lugar de la I mayúscula. La r seguida de la n que se convierte en una m. Un acento tragado. En una película entera, acaba notándose.
Así que AiSrt devuelve el texto reconocido a tu servicio de traducción, con una instrucción precisa: corrige los errores de lectura, no traduzcas nada, no reformules nada, no acortes nada. Es una revisión, no una reescritura. De los 100 subtítulos de un fragmento de película que pasé por el banco de pruebas, se corrigieron 14, 86 ya estaban bien, y ni uno solo fue desplazado ni inventado.
La salvaguarda importa más que la funcionalidad, así que la detallo. Solo se acepta una corrección si sigue siendo cercana a lo que se ha leído: un modelo que decidiera traducir una réplica acaba rechazado. Y si la respuesta no contiene exactamente tantos textos como los que se le enviaron, se abandona el lote entero y se conserva el texto en bruto. Prefiero un subtítulo con una errata visible que un subtítulo perfecto pegado a la réplica equivocada.
Esta revisión está activa por defecto y utiliza el servicio que ya traduce. Puedes apagarla, o confiársela a otro servicio, en appsettings.json. Y si no hay ninguna clave configurada, no pasa nada dramático: el texto del OCR se escribe tal cual, AiSrt te lo dice, y la extracción termina normalmente.
El bug que nunca habría encontrado sin buscarlo
Muchos discos hacen aparecer y desaparecer sus subtítulos gradualmente. Para eso, no envían una imagen nueva: reutilizan la misma cambiando solamente su transparencia. AiSrt tomaba este cambio por el final del subtítulo.
Resultado: un subtítulo mostrado durante cuatro segundos salía en tres trozos. El primero duraba un segundo, y los otros dos eran demasiado pálidos para poder releerlos, así que se descartaban. Ninguno de mis archivos de prueba hacía una transición gradual, así que fabriqué el caso expresamente para verlo. Tres trozos antes, un solo subtítulo de la duración correcta después.
AiSrt conserva ahora, entre los renderizados sucesivos, aquel en el que el texto es más legible. Una transición gradual empieza y termina siendo transparente: ni el primero ni el último es la elección correcta.
Lo que todavía no funciona
Los subtítulos de imagen de los DVD y de la TDT todavía no se decodifican. A diferencia del PGS, donde cada imagen es autónoma, estos formatos se leen con información guardada en otra parte del archivo. Es otro proyecto, no una ampliación de este. Mientras tanto, AiSrt los detecta y te avisa en lugar de ignorarlos en silencio.
Un flujo completo, del vídeo en bruto a los subtítulos traducidos
# Étape 1 : transcrire l'audio anglais
aisrt --transcribe "conference.mp4"
# donne conference.en.srt
# Étape 2 : traduire en français
aisrt "conference.en.srt" -s en -t fr
# donne conference.fr.srt
# Étape 3 : et en espagnol tant qu'à faire
aisrt "conference.en.srt" -s en -t es
# donne conference.es.srt
Tres comandos, y un vídeo sin subtítulos se vuelve accesible en tres idiomas.
Un pequeño detalle importante si automatizas todo esto: AiSrt devuelve 0 cuando todo ha ido bien, 1 en caso de fallo, y 2 si lo has cancelado tú mismo. Lo que ya se haya escrito en el disco se queda ahí, y la traducción se reanudará en el próximo lanzamiento.
Automatizarlo todo, sin una sola pregunta
Los tres comandos de arriba hacen preguntas: qué pista extraer, qué modelo usar, si hay que traducir después. Práctico cuando estás delante de la pantalla, mucho menos cuando quieres procesar una temporada completa durante la noche.
Cuatro opciones los sustituyen, y el flujo completo cabe entonces en una línea:
# Extraire la piste 2, la traduire en francais, sans jamais rien demander
aisrt --extract "episode.mkv" --stream 2 --translate-to fr --non-interactive
O para una carpeta entera, en Windows:
Get-ChildItem *.mkv | ForEach-Object {
aisrt --extract $_.FullName --stream 1 --translate-to fr --non-interactive
}
--non-interactive no adivina nada: cada pregunta toma su valor predeterminado, y te dice cuál ha elegido y qué opción habría permitido elegir otro. En cambio, un valor que das explícitamente nunca se ignora en silencio. Si pides la pista 7 de un archivo que solo tiene dos, se detiene y te lista las pistas disponibles, en vez de extraerlo todo como si no pasara nada. Para un script, un error claro vale más que un resultado inesperado.
Y si pulsas Ctrl+C en este modo, se detiene de inmediato, sin pedir confirmación. No habría nadie para responder, y una pregunta sin respuesta bloquearía el script para siempre.
Idiomas compatibles
| Código | Idioma | Código | Idioma | Código | Idioma |
|---|
ar | Árabe | cs | Checo | da | Danés |
de | Alemán | el | Griego | en | Inglés |
es | Español | fi | Finés | fr | Francés |
he | Hebreo | hi | Hindi | hu | Húngaro |
id | Indonesio | it | Italiano | ja | Japonés |
ko | Coreano | ms | Malayo | nl | Neerlandés |
no | Noruego | pl | Polaco | pt | Portugués |
ro | Rumano | ru | Ruso | sv | Sueco |
th | Tailandés | tr | Turco | uk | Ucraniano |
vi | Vietnamita | zh | Chino | | |
Escribe aisrt --languages para volver a encontrar esta lista en cualquier momento.
Configuración avanzada
Todo se configura en appsettings.json:
- El modelo, con la clave
Model, si prefieres otro modelo de OpenAI distinto de gpt-5-mini. - El tamaño de los lotes, con
BatchSize : el número de bloques enviados por solicitud, 40 por defecto. - La longitud de las líneas, con
MaxLineLength : por encima de 50 caracteres, AiSrt corta la línea para que siga siendo legible en pantalla. - El tiempo de espera de red, con
RequestTimeoutMinutes : 10 minutos por defecto. Si subes mucho BatchSize, sube este también. - Las instrucciones dadas a la IA, con
SystemPrompt y UserInstructionPrompt. Aquí es donde se pone interesante : puedes adaptar la traducción a un contexto jurídico, médico, religioso o técnico reescribiendo estos dos textos. Los saqué del código a propósito para eso. - La temperatura, entre 0.3 para una traducción muy literal y 1.5 para una traducción más libre. 1 por defecto.
- El motor de traducción, con
Provider en la sección Translation : openai, anthropic, gemini, xai u ollama. Es el ajuste que se aplica a todos tus comandos, mientras que --provider solo se aplica al que está en curso. - Los ajustes de Ollama, en su propia sección : la dirección del servidor con
BaseUrl, el modelo con Model, el tamaño de los lotes con BatchSize, y el tamaño de la ventana de contexto con NumCtx. Si aumentas la primera, acuérdate de aumentar la segunda. - El reconocimiento de caracteres, en la sección
Ocr : el idioma de respaldo con DefaultLanguage, el modo de segmentación de tesseract con PageSegMode, y el aumento de las imágenes antes de leerlas con UpscaleFactor. Los dos últimos están limitados : un valor disparatado se señala y se sustituye, en lugar de hacer que falle la lectura imagen por imagen. - La revisión del texto OCR, en
Ocr:Proofread : Enabled para desactivarla, Provider para confiarla a otro servicio distinto del que traduce, BatchSize para el tamaño de los lotes. Sus dos prompts se reescriben igual que los de la traducción.
¿Para quién?
- Las personas sordas y con problemas de audición, que necesitan subtítulos para acceder a los vídeos a diario.
- Los creadores de contenido que quieren llegar a un público más allá de su idioma.
- Los profesores y formadores cuyos cursos en línea merecen algo mejor que un subtitulado automático aproximado.
- Los traductores profesionales, para preparar un primer borrador en unos minutos.
- Los cinéfilos y aficionados a las series, obviamente.
- Las asociaciones y ONG que difunden vídeos internacionalmente.
AiSrt es gratuito y está listo para usar.
Descárgalo, pruébalo, y haz que tus vídeos sean accesibles para todos.
Join the conversation
You need an account to comment on this article. Creating one is free and takes under a minute.
Ningún comentario por el momento.