Elige texto o imagen
Elige Text to Video para partir de un prompt, o Image to Video para subir un primer fotograma, un primer y un último fotograma, o imágenes de referencia.
Una sola toma continua de hasta 30 segundos, con el sonido generado en la misma pasada
Wan 3.0 es el modelo de vídeo más reciente del equipo Tongyi Wan de Alibaba. Parte de un prompt de texto, de un primer fotograma (con un último fotograma opcional) o de hasta nueve imágenes de referencia, y elige entre 2 y 30 segundos en 480p, 720p o 1080p. El audio se genera junto con la imagen y el coste en créditos se muestra antes de enviar.
Crea un vídeo con Wan 3.0 en 4 pasos
Elige Text to Video para partir de un prompt, o Image to Video para subir un primer fotograma, un primer y un último fotograma, o imágenes de referencia.
Describe el sujeto, la acción, el movimiento de cámara, el escenario, el ambiente y cualquier diálogo o sonido que quieras oír.
Elige entre 2 y 30 segundos, 480p/720p/1080p y una relación de aspecto. La estimación de créditos se actualiza cada vez que cambias un ajuste.
Envía, espera unos minutos mientras Wan 3.0 renderiza y luego mira el clip completo antes de descargarlo o de afinar el prompt.
Tomas más largas, sonido nativo y tres formas de empezar
Wan 3.0 genera un único clip continuo de 2 a 30 segundos —el doble del límite de 15 segundos de Wan 2.7—, así que una escena puede arrancar, dar un giro y resolverse sin tener que empalmar fragmentos cortos.
Los diálogos, el ambiente y los efectos de sonido se generan junto con la imagen, así que los clips llegan con sonido en lugar de mudos. El audio está activado por defecto y desactivarlo no cambia el coste en créditos.
Escribe un prompt desde cero, anima una sola imagen como fotograma inicial o sube dos imágenes para fijar tanto el primer como el último fotograma y deja que Wan 3.0 cree el movimiento entre ambos.
Cambia Image Use a Reference Images para guiar personajes, productos, vestuario y localizaciones con hasta nueve imágenes, y menciónalas en el prompt como @image1, @image2, etc.
Alibaba diseñó Wan 3.0 en torno al realismo: rostros más expresivos y microexpresiones, sujetos más estables a lo largo de toda la toma y texto en pantalla más limpio que en versiones anteriores de Wan.
Genera en 480p para borradores rápidos, en 720p para el contenido del día a día o en 1080p para la entrega final, con encuadre 16:9, 9:16, 1:1, 4:3, 3:4 o Adaptive. El resultado es un MP4 a 30 fps.
Cómo crear un vídeo con Wan 3.0 online
El generador de Wan 3.0 de esta página ejecuta el modelo wan3.0-video de Alibaba en tu navegador: no hay nada que instalar y no necesitas clave de API ni consola en la nube. Sigue estos pasos para pasar de una idea o una imagen fija a un clip terminado.
Usa el playground de la parte superior de esta página; Wan 3.0 ya está seleccionado. Inicia sesión cuando quieras generar: Wan 3.0 funciona con un plan de pago o con créditos comprados.
Quédate en Text to Video para generar solo a partir del prompt. Para Image to Video, pon Image Use en First / Last Frame (la imagen 1 abre el clip y una imagen 2 opcional lo cierra) o en Reference Images (hasta nueve).
Escribe la escena como una breve lista de planos: quién aparece en cuadro, qué hace, cómo se mueve la cámara y qué se oye. Con imágenes de referencia, nómbralas como @image1, @image2 para que el modelo sepa cuál es cuál.
Elige entre 2 y 30 segundos y después 480p, 720p o 1080p. Usa 9:16 para Reels y TikTok, 16:9 para YouTube, 1:1 para los feeds o Adaptive para que el modelo encuadre la toma.
Envía y deja que Wan 3.0 renderice: los clips más largos y de mayor resolución tardan más. Revisa rostros, manos, texto y sincronización del audio, y después descarga o ajusta una sola indicación cada vez.
Por segundo, 480p cuesta aproximadamente una cuarta parte que 1080p. Clava el movimiento y el ritmo con un borrador corto en 480p y vuelve a lanzar el prompt ganador a resolución completa.
Un clip de 30 segundos necesita más de un momento. Describe la escena en orden —inicio, acción, giro, final— para que el modelo tenga algo que hacer durante toda la duración.
Cuando importan la pose final o el plano del producto, súbelos como último fotograma. Wan 3.0 planifica el movimiento para que el clip termine exactamente en esa imagen.
Como el audio se genera junto con la imagen, descríbelo: una frase de diálogo entre comillas, lluvia contra una ventana, una multitud que vitorea. Las indicaciones concretas dan un sonido más convincente.
Vídeo con IA en tomas largas para todo tipo de creadores
Pon en escena un momento completo de 30 segundos con personajes coherentes, diálogo y sonido: ideal para microdramas, teasers de historias y pruebas de personajes.
Convierte fotos de producto en escaparates en movimiento, fija el plano principal como último fotograma y revisa etiquetas y geometría antes de publicar el clip.
Produce clips verticales 9:16 para TikTok, Reels y Shorts con el sonido ya incluido, e itera rápido en 480p antes de los renders finales.
Visualiza un concepto, un proceso o un lugar en un clip narrado para clases, onboarding y presentaciones.
Todo sobre el generador de vídeo Wan 3.0
Wan 3.0 (wan3.0-video) es el modelo de vídeo más reciente de Tongyi Lab de Alibaba, lanzado en beta pública el 6 de agosto de 2026. Es un modelo todo en uno: un mismo motor se encarga de texto a vídeo, de imagen a vídeo con primer/último fotograma y de la generación guiada por referencias, con clips de hasta 30 segundos y audio generado en la misma pasada.
Puedes generar a partir de un prompt de texto, animar un primer fotograma, fijar un primer y un último fotograma, o guiar el vídeo con hasta nueve imágenes de referencia. A través de la API de Alibaba, Wan 3.0 también puede leer vídeo, audio, documentos y páginas web de referencia; esas entradas todavía no están disponibles en esta página.
Cualquier número entero de segundos entre 2 y 30, en 480p, 720p o 1080p, entregado como MP4 a 30 fps. Wan 3.0 no tiene un nivel 4K: las afirmaciones sobre una salida en 4K no son correctas.
Wan 3.0 se cobra por segundo de vídeo generado: unos 2,74 créditos por segundo en 480p, 5,48 en 720p y 10,96 en 1080p, redondeado al alza por vídeo. Un clip de 5 segundos cuesta 14 créditos en 480p, 28 en 720p o 55 en 1080p; un clip de 30 segundos en 1080p cuesta 329 créditos. Activar o desactivar el audio no cambia el precio, y el coste exacto se muestra antes de generar.
First / Last Frame trata tus imágenes como fotogramas exactos: la imagen 1 abre el clip y una imagen 2 opcional lo cierra. Reference Images trata hasta nueve imágenes como guía para personajes, objetos y lugares que pueden aparecer en cualquier momento del vídeo. Los dos modos no se pueden combinar en una misma generación.
Sí. Todos los planes de pago incluyen una licencia comercial, así que puedes usar tus vídeos de Wan 3.0 en anuncios, proyectos para clientes, redes sociales y productos que vendas. El plan gratuito es solo para uso personal. Sigues siendo responsable de lo que aportas: obtén los derechos de personas, marcas, música y material de origen de tus prompts e imágenes de referencia antes de publicar.
Sí. El audio se genera junto con la imagen y está activado por defecto, así que los diálogos, el ambiente y los efectos llegan sincronizados. Puedes desactivarlo para obtener un clip sin sonido; el coste en créditos es el mismo en ambos casos.
No. A diferencia de las versiones de pesos abiertos Wan 2.1 y 2.2, Wan 3.0 es un modelo cerrado disponible solo a través de APIs en la nube, así que no hay pesos oficiales que descargar. Considera no oficial cualquier «descarga gratuita de Wan 3.0».
Puedes explorar los ajustes y ver el coste exacto en créditos sin pagar. Para generar con Wan 3.0 necesitas un plan de pago o créditos comprados; los créditos se cobran al enviar y se reembolsan automáticamente si la generación falla.
La mayoría de los clips están listos en uno a cinco minutos aproximadamente. Las duraciones más largas y el 1080p tardan más, así que empieza con un borrador corto en 480p para comprobar el movimiento antes de renderizar la versión final.