Concepts
Text processing
Cómo se limpia la transcripción cruda antes de mandarla a la IA, sin usar ningún modelo.
Determinista, no generativo
El procesamiento es la etapa que reconstruye el texto hablado a partir de los subtítulos crudos: quita anotaciones como [música] o [aplausos], y deduplica fragmentos repetidos que suelen aparecer en subtítulos con “rolling captions” (donde una misma frase se repite mientras se va completando en pantalla). Nada de esto usa IA – son reglas de código, así que el resultado es siempre el mismo para el mismo input, y no tiene costo.
Dos archivos de salida
ogacai procesar produce:
- Una extracción fiel del texto de los subtítulos (
transcripcion_raw.txt). - Una versión limpia (
transcripcion_clean.txt), que es la que efectivamente se le manda al proveedor de IA en la etapa siguiente.
Muletillas opcionales
Con --sin-muletillas, se quitan del texto limpio muletillas comunes en español (“eh”, “o sea”, “bueno”, “este”…) antes de generarlo. Es opcional porque en algunos casos esas muletillas aportan tono al video de origen y se prefiere conservarlas.
ogacai procesar ./salida/<archivo> --sin-muletillas
Revisar antes de generar
ogacai preview muestra en pantalla, sin escribir archivos, exactamente qué se descartó al limpiar – útil para confirmar que la limpieza no eliminó algo importante antes de gastar una llamada a la IA en la etapa de AI generation.