CogVideoX-5b¶
En este artículo
Información
CogVideoX-5b es ein modelo para generar vídeos utilizando tecnologías de inteligencia artificial, accesible a través de la interfaz Huggingface Space. Su arquitectura se basa en modelos cognitivos y transformers para la creación de contenido visual.
CogVideoX-5b. Funcionalidades clave¶
- Text-to-video generation — transforma descripciones de texto en segmentos de vídeo de alta calidad con una fuerte coherencia semántica y visual;
- Soporte para varias resoluciones y formatos — capacidad para crear vídeos en diferentes relaciones de aspecto y resoluciones para diversos propósitos;
- Comprensión cognitiva del contexto — interpretación mejorada de las solicitudes del usuario gracias a modelos de lenguaje preentrenados;
- Interfaz gráfica — una interfaz web cómoda para interactuar con el modelo sin necesidad de programación;
- Mejora de la calidad de vídeo — modelos integrados para aumentar la resolución y la tasa de fotogramas (RIFE);
- Parámetros de generación personalizables — capacidad para ajustar finamente el estilo, la velocidad de animación y otras características del vídeo;
- Escalabilidad — funcionamiento eficiente en GPUs con soporte para computación paralela;
- Código de código abierto — disponibilidad del código y los pesos del modelo para comunidades de investigación y desarrolladores.
Funcionalidades de implementación¶
| ID | Nombre del Software | SO Compatible | VM | BM | VGPU | GPU | CPU Mín. (Núcleos) | RAM Mín. (GB) | HDD/SSD Mín. (GB) | Dominio Personalizado | Activo |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 272 | CogVideo | Ubuntu 22.04 | + | + | + | + | 4 | 32 | 50 | No | PEDIR |
Información
Para obtener información sobre las funcionalidades de implementación de este software, consulte este enlace.
- Requisitos del sistema: Para un rendimiento óptimo, se recomienda disponer de al menos 24 GB de VRAM en una GPU.
- SAT BF16: 76 GB de VRAM;
- diffusers BF16: desde 10 GB de VRAM;
- diffusers INT8 (torchao): desde 7 GB de VRAM;
- Modo Multi-GPU (BF16): aproximadamente 24 GB por GPU al usar diffusers.
- Resoluciones de vídeo soportadas: resolución base: 1360 × 768;
- Número de fotogramas: debe seguir la fórmula 16N + 1, donde N ≤ 10 (por defecto 81 fotogramas);
- Tasa de fotogramas: 16 fps;
- Duración del vídeo: 5-10 segundos;
- Precisión recomendada: BF16 (también se admiten FP16, FP32, FP8*, INT8; INT4 no es compatible);
- Velocidad de generación (50 pasos): ~1000 segundos en NVIDIA A100, ~550 segundos en NVIDIA H100.
- Dependencias preinstaladas:
- Python 3.9
- python3.9-venv (herramienta para crear entornos de Python aislados)
- python3.9-dev (archivos de cabecera y librerías para desarrollo)
- python3-pip (gestor de paquetes de Python)
- NVIDIA drivers
- nvidia-docker2
- docker.io
- nginx-certbot
- git
- curl
- wget
- Directorio del proyecto:
/opt/CogVideo.
Primeros pasos con CogVideoX-5b tras la implementación¶
Tras el pago, se enviará una notificación a la dirección de correo electrónico proporcionada durante el registro indicando que el servidor está listo para su uso. Esta incluirá la dirección IP del VPS y las credenciales de acceso. Los clientes de nuestra empresa gestionan el equipo a través del server management panel and API — Invapi.
Los datos de inicio de sesión se pueden encontrar ya sea en la pestaña Configuration >> Tags del panel de control del servidor o en el correo electrónico enviado:
- Enlace para acceder al panel de gestión de CogVideoX-5b a través de la interfaz web: en la etiqueta webpanel de ;
- Login y Password: enviados por correo electrónico tras la liberación del servidor.
Menú de inicio de CogVideoX-5b¶
Tras hacer clic en el enlace de la etiqueta webpanel de , se abrirá el menú de inicio de CogVideoX.

Para generar contenido, siga estos pasos:
-
Tenga en cuenta la advertencia: esta herramienta de demostración está destinada únicamente a la investigación académica y al uso experimental.
-
Si el espacio está sobrecargado, puede crear una copia personal haciendo clic en "Duplicate this Space".
Entrada de datos
-
Tiene dos opciones para la entrada de datos (no pueden usarse simultáneamente):
- I2V: entrada de imagen (no se puede usar simultáneamente con vídeo);
- V2V: entrada de vídeo (no se puede usar simultáneamente con una imagen).
-
Introduzca el prompt de texto en el campo correspondiente. Límite: menos de 200 palabras.
-
Opcional: haga clic en el botón
Enhance Promptpara mejorar su consulta utilizando el modelo GLM-4, lo que mejorará su texto original.
Configuración de parámetros
-
Introduzca un valor para Inference Seed:
- Un número positivo para una semilla específica. Al introducir un número positivo (p. ej., 42, 123, 1000), el sistema lo utiliza como punto de partida para el generador de números aleatorios, garantizando la reproducibilidad del resultado. El uso de la misma semilla con el mismo prompt y ajustes producirá resultados idénticos o muy similares en generaciones posteriores;
- -1 para una semilla aleatoria. Cada generación será única, incluso si utiliza el mismo prompt y ajustes.
-
Seleccione opciones adicionales (opcional):
- Super-Resolution: actívelo para aumentar la resolución (720 × 480 > 2880 × 1920)
- Frame Interpolation: actívelo para aumentar la tasa de fotogramas (8fps > 16fps)
-
Tenga en cuenta que en la demo:
- Se utiliza RIFE para la interpolación de fotogramas;
- Se utiliza Real-ESRGAN para la superresolución.
-
Haga clic en el botón
Generate Videoen la parte inferior de la pantalla. -
Espere a que se complete la generación: los resultados se mostrarán en el lado derecho de la interfaz.
Nota
Puede encontrar información detallada sobre el uso de CogVideoX-5b en la documentación oficial del proyecto.
Pedido de un servidor con CogVideoX-5b mediante API¶
Para instalar este software utilizando la API, siga esta instrucción.