Concepts

Text processing

Cómo se limpia la transcripción cruda antes de mandarla a la IA, sin usar ningún modelo.

Determinista, no generativo

El procesamiento es la etapa que reconstruye el texto hablado a partir de los subtítulos crudos: quita anotaciones como [música] o [aplausos], y deduplica fragmentos repetidos que suelen aparecer en subtítulos con “rolling captions” (donde una misma frase se repite mientras se va completando en pantalla). Nada de esto usa IA – son reglas de código, así que el resultado es siempre el mismo para el mismo input, y no tiene costo.

Dos archivos de salida

ogacai procesar produce:

  • Una extracción fiel del texto de los subtítulos (transcripcion_raw.txt).
  • Una versión limpia (transcripcion_clean.txt), que es la que efectivamente se le manda al proveedor de IA en la etapa siguiente.

Muletillas opcionales

Con --sin-muletillas, se quitan del texto limpio muletillas comunes en español (“eh”, “o sea”, “bueno”, “este”…) antes de generarlo. Es opcional porque en algunos casos esas muletillas aportan tono al video de origen y se prefiere conservarlas.

ogacai procesar ./salida/<archivo> --sin-muletillas

Revisar antes de generar

ogacai preview muestra en pantalla, sin escribir archivos, exactamente qué se descartó al limpiar – útil para confirmar que la limpieza no eliminó algo importante antes de gastar una llamada a la IA en la etapa de AI generation.