AITrainer: motor serverless de IA que convierte horas de vídeo operativo en píldoras de conocimiento estructurado
AITrainer es un motor de procesamiento en segundo plano, impulsado por IA generativa sobre Google Cloud, que transforma horas de grabaciones de formación, operativa y despliegue de perfiles en píldoras de conocimiento estructurado. Diseñado como pipeline serverless resiliente, ingesta archivos masivos desde local o nube, los fragmenta en contenedores efímeros, los analiza con Vertex AI y entrega JSON limpio listo para indexar — sin bloquear los sistemas de la empresa ni disparar costes.
Resultados
2h+
Duración de vídeo soportada
archivos de varios GB por pieza
de jornadas a minutos
Reducción de trabajo manual
desatendida
Ejecución
en segundo plano, sin bloquear sistemas
acotada
Concurrencia
mutex global + Cloud Tasks
≈ 0€
Coste de almacenamiento residual
GC automático post-proceso
JSON estructurado
Salida
listo para indexar y consultar
El reto
La operativa del cliente genera diariamente material audiovisual masivo: sesiones de formación, operativas de servicios, despliegue de perfiles de usuario y gestión táctica de herramientas. Archivos que superan las 2 horas y los varios gigabytes por pieza.
Revisar y sintetizar manualmente ese volumen era inviable. El conocimiento se quedaba enterrado en vídeos monolíticos que casi nadie volvía a abrir, y las dudas operativas se resolvían preguntando en lugar de consultando la fuente.
El reto: una plataforma capaz de ingerir archivos masivos desde múltiples orígenes (local o nube), procesarlos en segundo plano sin saturar la infraestructura, y extraer de forma autónoma los puntos críticos de cada sesión, con costes de almacenamiento tendentes a cero.
La solución
Ingesta unificada, deduplicación e idempotencia
La entrada se unifica: da igual si se sube un archivo suelto o un directorio con decenas de vídeos. Los archivos se transfieren de forma concurrente a buckets temporales de Cloud Storage con una capa de deduplicación nativa por huella única, de modo que recargar la interfaz o reenviar la petición nunca duplica trabajo ni provoca colisiones.
- Subida concurrente desde local y nube
- Hash por archivo → idempotencia end-to-end
- Buckets temporales con ciclo de vida corto
Fase Macro: fragmentación inteligente con mutex global
Un vídeo de dos horas no puede enviarse de una sola pieza a un modelo. El motor corta cada original en fragmentos asíncronos manejables usando procesamiento multimedia avanzado, dentro de contenedores efímeros que asignan y liberan memoria dinámicamente. Un Semáforo Global (Global Mutex Lock) regula la concurrencia para que los recursos nunca se saturen.
- Contenedores efímeros con memoria dinámica
- Global Mutex Lock que regula el throughput
- Cloud Tasks como cola con concurrencia acotada
Fase Micro: análisis con Vertex AI
Cada fragmento pasa secuencialmente por modelos de IA generativa de última generación en Vertex AI. La IA actúa como un auditor experto: visualiza el vídeo, escucha las transcripciones y extrae píldoras de conocimiento automáticas. Descarta el ruido conversacional y devuelve estructuras JSON limpias, tipadas y listas para indexar.
- Modelos multimodales de Vertex AI (vídeo + audio)
- Salida JSON validada por esquema
- Descarte automático de ruido y off-topic
Telemetría, cierre de ciclo y garbage collector
Al finalizar, el sistema compila el conocimiento y genera un resumen ejecutivo del procesamiento. En milisegundos actualiza Firestore en tiempo real con métricas precisas: número de píldoras extraídas, tiempo de procesamiento, tokens consumidos y nivel de confianza de la IA. Después, un Garbage Collector limpia toda la infraestructura temporal para mantener los costes de almacenamiento a cero.
- Firestore en tiempo real para el frontend
- Métricas: píldoras, tokens, tiempo, confianza
- GC automático de buckets y artefactos intermedios
Píldoras de conocimiento accesibles a toda la empresa
Los vídeos monolíticos se convierten en fragmentos consultables. Cualquier empleado accede directamente a la instrucción exacta que necesita — resolución de dudas operativas, onboarding, despliegue de perfiles o gestión de herramientas — sin volver a ver la grabación completa.
Arquitectura del pipeline
- 01
Ingesta
Subida concurrente local/nube a Cloud Storage con hash e idempotencia.
- 02
Fragmentación
Corte multimedia en contenedores efímeros regulados por mutex global.
- 03
Cola
Cloud Tasks orquesta el flujo con concurrencia estricta y reintentos.
- 04
Análisis IA
Vertex AI multimodal extrae píldoras JSON por fragmento.
- 05
Telemetría
Firestore en tiempo real con métricas de píldoras, tokens y confianza.
- 06
Garbage Collector
Limpieza de buckets temporales: coste de almacenamiento residual → 0.
Stack tecnológico
Servicios aplicados
Preguntas frecuentes
¿Qué tipo de vídeos procesa AITrainer?+
Cualquier material audiovisual operativo: sesiones de formación, operativas de servicio, despliegue de perfiles de usuario, gestión táctica de herramientas o reuniones grabadas. El sistema soporta archivos de más de dos horas y varios gigabytes por pieza.
¿Cómo se garantiza que no se procesa dos veces el mismo archivo?+
Con deduplicación nativa por huella única y un pipeline idempotente extremo a extremo. Recargar la interfaz, reenviar la petición o reintentar una tarea nunca duplica trabajo ni provoca colisiones en el estado.
¿Cómo se controla el coste de infraestructura?+
Cloud Tasks acota la concurrencia, un Global Mutex Lock regula el throughput dentro de cada worker, y un Garbage Collector limpia todos los buckets temporales al terminar cada job. El almacenamiento residual tiende a cero y la factura crece de forma lineal y previsible.
¿Se puede replicar esta arquitectura para otro cliente?+
Sí. El patrón (ingesta idempotente → fragmentación con mutex → Vertex AI → telemetría en Firestore → GC) es reutilizable para cualquier caso que requiera procesar vídeo largo con IA generativa: formación, atención al cliente, compliance, medios o industria.
¿Un caso similar en tu empresa?
Cuéntanos tu operativa formativa o de soporte y te compartimos arquitectura, alcance y estimación en 48h.