Caso de éxito · AITrainerEn producciónFormación corporativa · Operativa interna

AITrainer: motor serverless de IA que convierte horas de vídeo operativo en píldoras de conocimiento estructurado

AITrainer es un motor de procesamiento en segundo plano, impulsado por IA generativa sobre Google Cloud, que transforma horas de grabaciones de formación, operativa y despliegue de perfiles en píldoras de conocimiento estructurado. Diseñado como pipeline serverless resiliente, ingesta archivos masivos desde local o nube, los fragmenta en contenedores efímeros, los analiza con Vertex AI y entrega JSON limpio listo para indexar — sin bloquear los sistemas de la empresa ni disparar costes.

Resultados

2h+

Duración de vídeo soportada

archivos de varios GB por pieza

de jornadas a minutos

Reducción de trabajo manual

desatendida

Ejecución

en segundo plano, sin bloquear sistemas

acotada

Concurrencia

mutex global + Cloud Tasks

≈ 0€

Coste de almacenamiento residual

GC automático post-proceso

JSON estructurado

Salida

listo para indexar y consultar

El reto

La operativa del cliente genera diariamente material audiovisual masivo: sesiones de formación, operativas de servicios, despliegue de perfiles de usuario y gestión táctica de herramientas. Archivos que superan las 2 horas y los varios gigabytes por pieza.

Revisar y sintetizar manualmente ese volumen era inviable. El conocimiento se quedaba enterrado en vídeos monolíticos que casi nadie volvía a abrir, y las dudas operativas se resolvían preguntando en lugar de consultando la fuente.

El reto: una plataforma capaz de ingerir archivos masivos desde múltiples orígenes (local o nube), procesarlos en segundo plano sin saturar la infraestructura, y extraer de forma autónoma los puntos críticos de cada sesión, con costes de almacenamiento tendentes a cero.

La solución

Ingesta unificada, deduplicación e idempotencia

La entrada se unifica: da igual si se sube un archivo suelto o un directorio con decenas de vídeos. Los archivos se transfieren de forma concurrente a buckets temporales de Cloud Storage con una capa de deduplicación nativa por huella única, de modo que recargar la interfaz o reenviar la petición nunca duplica trabajo ni provoca colisiones.

  • Subida concurrente desde local y nube
  • Hash por archivo → idempotencia end-to-end
  • Buckets temporales con ciclo de vida corto

Fase Macro: fragmentación inteligente con mutex global

Un vídeo de dos horas no puede enviarse de una sola pieza a un modelo. El motor corta cada original en fragmentos asíncronos manejables usando procesamiento multimedia avanzado, dentro de contenedores efímeros que asignan y liberan memoria dinámicamente. Un Semáforo Global (Global Mutex Lock) regula la concurrencia para que los recursos nunca se saturen.

  • Contenedores efímeros con memoria dinámica
  • Global Mutex Lock que regula el throughput
  • Cloud Tasks como cola con concurrencia acotada

Fase Micro: análisis con Vertex AI

Cada fragmento pasa secuencialmente por modelos de IA generativa de última generación en Vertex AI. La IA actúa como un auditor experto: visualiza el vídeo, escucha las transcripciones y extrae píldoras de conocimiento automáticas. Descarta el ruido conversacional y devuelve estructuras JSON limpias, tipadas y listas para indexar.

  • Modelos multimodales de Vertex AI (vídeo + audio)
  • Salida JSON validada por esquema
  • Descarte automático de ruido y off-topic

Telemetría, cierre de ciclo y garbage collector

Al finalizar, el sistema compila el conocimiento y genera un resumen ejecutivo del procesamiento. En milisegundos actualiza Firestore en tiempo real con métricas precisas: número de píldoras extraídas, tiempo de procesamiento, tokens consumidos y nivel de confianza de la IA. Después, un Garbage Collector limpia toda la infraestructura temporal para mantener los costes de almacenamiento a cero.

  • Firestore en tiempo real para el frontend
  • Métricas: píldoras, tokens, tiempo, confianza
  • GC automático de buckets y artefactos intermedios

Píldoras de conocimiento accesibles a toda la empresa

Los vídeos monolíticos se convierten en fragmentos consultables. Cualquier empleado accede directamente a la instrucción exacta que necesita — resolución de dudas operativas, onboarding, despliegue de perfiles o gestión de herramientas — sin volver a ver la grabación completa.

Arquitectura del pipeline

  1. 01

    Ingesta

    Subida concurrente local/nube a Cloud Storage con hash e idempotencia.

  2. 02

    Fragmentación

    Corte multimedia en contenedores efímeros regulados por mutex global.

  3. 03

    Cola

    Cloud Tasks orquesta el flujo con concurrencia estricta y reintentos.

  4. 04

    Análisis IA

    Vertex AI multimodal extrae píldoras JSON por fragmento.

  5. 05

    Telemetría

    Firestore en tiempo real con métricas de píldoras, tokens y confianza.

  6. 06

    Garbage Collector

    Limpieza de buckets temporales: coste de almacenamiento residual → 0.

Stack tecnológico

Google CloudVertex AICloud TasksCloud RunFirestoreFFmpeg

Preguntas frecuentes

¿Qué tipo de vídeos procesa AITrainer?+

Cualquier material audiovisual operativo: sesiones de formación, operativas de servicio, despliegue de perfiles de usuario, gestión táctica de herramientas o reuniones grabadas. El sistema soporta archivos de más de dos horas y varios gigabytes por pieza.

¿Cómo se garantiza que no se procesa dos veces el mismo archivo?+

Con deduplicación nativa por huella única y un pipeline idempotente extremo a extremo. Recargar la interfaz, reenviar la petición o reintentar una tarea nunca duplica trabajo ni provoca colisiones en el estado.

¿Cómo se controla el coste de infraestructura?+

Cloud Tasks acota la concurrencia, un Global Mutex Lock regula el throughput dentro de cada worker, y un Garbage Collector limpia todos los buckets temporales al terminar cada job. El almacenamiento residual tiende a cero y la factura crece de forma lineal y previsible.

¿Se puede replicar esta arquitectura para otro cliente?+

Sí. El patrón (ingesta idempotente → fragmentación con mutex → Vertex AI → telemetría en Firestore → GC) es reutilizable para cualquier caso que requiera procesar vídeo largo con IA generativa: formación, atención al cliente, compliance, medios o industria.

¿Un caso similar en tu empresa?

Cuéntanos tu operativa formativa o de soporte y te compartimos arquitectura, alcance y estimación en 48h.