March Code
Producción de vídeo con IA

Dubler: un gemelo digital que graba tus Reels por ti

Un SaaS que convierte una idea dictada por voz en un Reel de Instagram terminado en unos 10 minutos: un director con IA escribe el guion y un storyboard con presupuesto, y en pantalla aparece, en tu lugar, un gemelo digital con tu voz clonada. No hace falta ninguna cámara.

Cliente: March Code (producto propio)IASaaS
Dubler: un gemelo digital que graba tus Reels por ti

29 pantallas

de un SaaS completo

~10 min

de la idea al paquete

1 foto

para un gemelo digital

0 rodajes

ninguna cámara en absoluto

01

Reto

Los vídeos verticales cortos son el principal canal de alcance para expertos y pequeños negocios. Pero entre «tengo una idea» y «el vídeo ya está publicado» hay toda una producción: guion, grabación, iluminación, edición, subtítulos, portadas. Ahí es justo donde mueren los planes de contenido: no hay tiempo para grabar, ponerse delante de la cámara da apuro y un editor sale caro.

Nos preguntamos: ¿y si elimináramos la grabación por completo? El usuario aporta una sola vez una foto y cinco minutos de grabación de voz, y a partir de ahí su doble digital hace el trabajo delante de la cámara. Solo quedaba construir un producto que pasara de la «idea dictada por voz» al «paquete listo para publicar» en unos diez minutos y que mostrara con honestidad el coste antes de cada generación.

Dubler es el SaaS propio del estudio y, a la vez, un escaparate: así demostramos cómo construimos productos comerciales de IA de principio a fin, desde el pipeline de LLM y la facturación hasta el programa de afiliados.

02

Solución

Tres pasos hasta el vídeo terminado

Cuenta tu idea

Un mensaje de voz, un texto o un clip de talking head ya grabado. El discurso se entiende palabra por palabra, porque la transcripción calcula los tiempos de cada palabra

Aprueba el storyboard

El director de IA desglosa el discurso segundo a segundo, propone planos de recurso y te enseña una vista previa de cada escena junto con un presupuesto. Solo se cobra cuando das el visto bueno

Recibe el paquete

Un vídeo 9:16 con jump cuts y subtítulos estilo karaoke, una versión para Stories sin el CTA, tres portadas y un texto con hashtags, todo en un solo archivo comprimido

Las funciones «wow» que hacen el producto

Director de IA
Un plan de edición en una sola llamada
  • El LLM construye el plan completo: un gancho de ≤5 palabras, planos de recurso colocados estrictamente sobre las frases, pattern interrupts
  • El plan se valida de forma determinista, así que el director no puede «romper» el vídeo
  • Cada plano de recurso explica por qué está ahí, con su prompt y su precio
Gemelo digital
Una foto + 5 minutos de voz
  • Un talking head con sincronización labial se genera a partir de una sola foto
  • El vestuario y la localización se describen con palabras, como «traje azul» o «estudio de neón», sin imágenes de referencia
  • Clon de voz con comparación A/B de ajustes y entrenamiento extra con las palabras problemáticas
Economía honesta
Presupuesto antes de generar
  • Cada generación se presupuesta por adelantado: el usuario aprueba un precio, no se lleva una sorpresa al final
  • Créditos: retención → cobro en una sola transacción con su asiento en el libro mayor, y reembolso automático si algo falla
  • La versión para Stories sale del mismo montaje: un segundo formato sin un segundo presupuesto
Asistente
El chat hace todo lo que hacen los botones
  • 15 herramientas, desde elegir un estudio hasta lanzar el render, que aparecen como tarjetas dentro de la conversación
  • Las acciones caras solo pasan por una tarjeta de confirmación con el precio
  • El motor no depende del canal: ahora web, después Telegram

El pipeline por dentro

Voz → tiempos

Transcripción con tiempos por palabra; los límites del habla se ajustan a una rejilla de fotogramas de 30 fps, así que el desfase con la sincronización labial es imposible por diseño

Director → plan

El LLM devuelve el plan de edición en JSON; el plan pasa una validación determinista y se convierte en un storyboard con presupuesto

Generación

Los planos de recurso en vídeo y la locución se generan en paralelo con reintento ×3; las colas de BullMQ sobreviven a los reinicios, y los stale guards rematan las tareas atascadas

Remotion → paquete

Render 9:16 con subtítulos estilo karaoke, una versión para Stories, tres portadas y un texto con hashtags, todo en un solo archivo comprimido

Lo asíncrono como principio de UX

La generación tarda minutos, pero el usuario nunca se queda bloqueado: tarjetas de progreso en vivo con fases y tiempo estimado, skeletons en lugar de spinners, streams SSE en lugar de recargar la página. El producto se siente rápido incluso cuando por debajo trabajan modelos de vídeo pesados.

03

El sistema por dentro

Pantallas reales de un sistema en funcionamiento, no maquetas. Haz clic para verlas de cerca

Producto
Un escaparate de vídeos reales generados por el servicio, con la cara y la voz del propietario. No se grabó ni un solo fotograma con cámara
El panel de «pendientes»: vídeos a la espera de una decisión, acciones rápidas y los últimos trabajos terminados, para que el usuario siempre sepa cuál es el siguiente paso
Pipeline de vídeo
El storyboard del director con presupuesto: cada plano de recurso trae vista previa, prompt, precio y el motivo por el que está ahí. La generación solo empieza cuando das el visto bueno
Un vídeo terminado: el paquete de publicación, cambios con una sola orden («hazlo más contundente»), una versión para Stories y el informe del director sobre por qué se montó así
Portada híbrida: la escena se genera con la cara del usuario y el titular se renderiza encima, así que incluso el texto en cirílico sale sin artefactos
Gemelo digital
Un talking head a partir de una foto: localizaciones de estudio y vestuario en tarjetas, o descríbelos en una sola frase. Después viene la animación con sincronización labial
Clon de voz: hasta 5 minutos de grabación, el carácter de la voz se elige con chips, comparación A/B de ajustes y entrenamiento extra con las palabras problemáticas
Asistente y material propio
El chat del asistente hace todo lo que hacen los botones: tarjetas de estudio dentro de la conversación, guía paso a paso y confirmación del precio antes de cada cobro
Tu propio material como base para los vídeos: transcripción con búsqueda por palabras, análisis de escenas y un botón de «hacer un vídeo con este material»
04

Resultados

29 pantallas

de un SaaS completo

Facturación con créditos contabilizados en libro mayor, un asistente con 15 herramientas, 34 presets «wow», 3 modelos de vídeo a elegir y un programa de afiliados con calculadora de viralidad

~10 min

de la idea al paquete

Una idea dictada por voz se convierte en un vídeo 9:16 con jump cuts y subtítulos, una versión para Stories, tres portadas y un texto con hashtags, todo en un solo archivo comprimido

1 foto

para un gemelo digital

Un talking head con sincronización labial se genera a partir de una foto, y el clon de voz, con 5 minutos de grabación. El vestuario y la localización se describen con palabras normales

0 rodajes

ninguna cámara en absoluto

Todo el escaparate del producto son vídeos en los que no se grabó ni un solo fotograma con cámara: escenas, planos de recurso y portadas se generan con la cara del propietario

05

Análisis en profundidad

Decisiones de ingeniería de las que estamos orgullosos

El dinero se trata como en un banco
  • Créditos: retención → cobro/liberación en una sola transacción con un libro mayor append-only
  • Cobros idempotentes con claves únicas, así que es imposible cobrar dos veces
  • Reembolsos según el uso real: si una generación falla, el dinero vuelve solo
Sincronización labial que no se rompe
  • Los jump cuts se hacen sobre una rejilla de fotogramas de 30 fps, así que audio y vídeo se cortan exactamente igual
  • El desfase es imposible por diseño, no es que «normalmente no pase»
Multi-tenancy y seguridad
  • Cada tabla de negocio lleva su propio orgId; el acceso pasa solo por un scope de JWT
  • Producción: Docker Compose, Caddy con TLS automático, MinIO en un volumen dedicado, contenedores sin root
Resistencia a las caídas de proveedores
  • Los fallos transitorios de los modelos de vídeo y de TTS se reintentan con backoff
  • Las colas sobreviven a los reinicios; una pasarela de LLM con niveles y caché reduce los costes

¿Quieres un producto así?

Dubler es nuestra forma de construir productos comerciales de IA de principio a fin: pipelines de LLM con validación determinista, facturación honesta basada en libro mayor, UX asíncrona e infraestructura de producción. Si tienes una idea de producto donde la IA se cruza con el contenido, cuéntanosla: construimos un prototipo, calculamos la economía unitaria y lo llevamos a producción. Déjanos tu solicitud en el formulario de abajo.

Tecnologías del proyecto

NestJS 10TypeORMPostgreSQL 16Redis 7BullMQReact 18ViteTailwindRemotionClaude APIfal.ai (Seedance / Kling)ElevenLabsWhisperMiniMax TTSffmpegDockerMinIO

Escríbenos directamente

Escríbenos: te respondemos en un día laborable y te ayudamos a concretar el proyecto.

Si nos contactas por mensajería o por correo electrónico, decides compartir tus datos de contacto para que respondamos a tu consulta. Tienes los detalles en nuestra Política de privacidad.