Saltar a contenido

CogVideoX-5b

En este artículo

Información

CogVideoX-5b es ein modelo para generar vídeos utilizando tecnologías de inteligencia artificial, accesible a través de la interfaz Huggingface Space. Su arquitectura se basa en modelos cognitivos y transformers para la creación de contenido visual.

CogVideoX-5b. Funcionalidades clave

  • Text-to-video generation — transforma descripciones de texto en segmentos de vídeo de alta calidad con una fuerte coherencia semántica y visual;
  • Soporte para varias resoluciones y formatos — capacidad para crear vídeos en diferentes relaciones de aspecto y resoluciones para diversos propósitos;
  • Comprensión cognitiva del contexto — interpretación mejorada de las solicitudes del usuario gracias a modelos de lenguaje preentrenados;
  • Interfaz gráfica — una interfaz web cómoda para interactuar con el modelo sin necesidad de programación;
  • Mejora de la calidad de vídeo — modelos integrados para aumentar la resolución y la tasa de fotogramas (RIFE);
  • Parámetros de generación personalizables — capacidad para ajustar finamente el estilo, la velocidad de animación y otras características del vídeo;
  • Escalabilidad — funcionamiento eficiente en GPUs con soporte para computación paralela;
  • Código de código abierto — disponibilidad del código y los pesos del modelo para comunidades de investigación y desarrolladores.

Funcionalidades de implementación

ID Nombre del Software SO Compatible VM BM VGPU GPU CPU Mín. (Núcleos) RAM Mín. (GB) HDD/SSD Mín. (GB) Dominio Personalizado Activo
272 CogVideo Ubuntu 22.04 + + + + 4 32 50 No PEDIR

Información

Para obtener información sobre las funcionalidades de implementación de este software, consulte este enlace.

  • Requisitos del sistema: Para un rendimiento óptimo, se recomienda disponer de al menos 24 GB de VRAM en una GPU.
    • SAT BF16: 76 GB de VRAM;
    • diffusers BF16: desde 10 GB de VRAM;
    • diffusers INT8 (torchao): desde 7 GB de VRAM;
    • Modo Multi-GPU (BF16): aproximadamente 24 GB por GPU al usar diffusers.
  • Resoluciones de vídeo soportadas: resolución base: 1360 × 768;
  • Número de fotogramas: debe seguir la fórmula 16N + 1, donde N ≤ 10 (por defecto 81 fotogramas);
  • Tasa de fotogramas: 16 fps;
  • Duración del vídeo: 5-10 segundos;
  • Precisión recomendada: BF16 (también se admiten FP16, FP32, FP8*, INT8; INT4 no es compatible);
  • Velocidad de generación (50 pasos): ~1000 segundos en NVIDIA A100, ~550 segundos en NVIDIA H100.
  • Dependencias preinstaladas:
    • Python 3.9
    • python3.9-venv (herramienta para crear entornos de Python aislados)
    • python3.9-dev (archivos de cabecera y librerías para desarrollo)
    • python3-pip (gestor de paquetes de Python)
    • NVIDIA drivers
    • nvidia-docker2
    • docker.io
    • nginx-certbot
    • git
    • curl
    • wget
  • Directorio del proyecto: /opt/CogVideo.

Primeros pasos con CogVideoX-5b tras la implementación

Tras el pago, se enviará una notificación a la dirección de correo electrónico proporcionada durante el registro indicando que el servidor está listo para su uso. Esta incluirá la dirección IP del VPS y las credenciales de acceso. Los clientes de nuestra empresa gestionan el equipo a través del server management panel and APIInvapi.

Los datos de inicio de sesión se pueden encontrar ya sea en la pestaña Configuration >> Tags del panel de control del servidor o en el correo electrónico enviado:

  • Enlace para acceder al panel de gestión de CogVideoX-5b a través de la interfaz web: en la etiqueta webpanel de ;
  • Login y Password: enviados por correo electrónico tras la liberación del servidor.

Menú de inicio de CogVideoX-5b

Tras hacer clic en el enlace de la etiqueta webpanel de , se abrirá el menú de inicio de CogVideoX.

Para generar contenido, siga estos pasos:

  1. Tenga en cuenta la advertencia: esta herramienta de demostración está destinada únicamente a la investigación académica y al uso experimental.

  2. Si el espacio está sobrecargado, puede crear una copia personal haciendo clic en "Duplicate this Space".

Entrada de datos

  1. Tiene dos opciones para la entrada de datos (no pueden usarse simultáneamente):

    • I2V: entrada de imagen (no se puede usar simultáneamente con vídeo);
    • V2V: entrada de vídeo (no se puede usar simultáneamente con una imagen).
  2. Introduzca el prompt de texto en el campo correspondiente. Límite: menos de 200 palabras.

  3. Opcional: haga clic en el botón Enhance Prompt para mejorar su consulta utilizando el modelo GLM-4, lo que mejorará su texto original.

Configuración de parámetros

  1. Introduzca un valor para Inference Seed:

    • Un número positivo para una semilla específica. Al introducir un número positivo (p. ej., 42, 123, 1000), el sistema lo utiliza como punto de partida para el generador de números aleatorios, garantizando la reproducibilidad del resultado. El uso de la misma semilla con el mismo prompt y ajustes producirá resultados idénticos o muy similares en generaciones posteriores;
    • -1 para una semilla aleatoria. Cada generación será única, incluso si utiliza el mismo prompt y ajustes.
  2. Seleccione opciones adicionales (opcional):

    • Super-Resolution: actívelo para aumentar la resolución (720 × 480 > 2880 × 1920)
    • Frame Interpolation: actívelo para aumentar la tasa de fotogramas (8fps > 16fps)
  3. Tenga en cuenta que en la demo:

    • Se utiliza RIFE para la interpolación de fotogramas;
    • Se utiliza Real-ESRGAN para la superresolución.
  4. Haga clic en el botón Generate Video en la parte inferior de la pantalla.

  5. Espere a que se complete la generación: los resultados se mostrarán en el lado derecho de la interfaz.

Nota

Puede encontrar información detallada sobre el uso de CogVideoX-5b en la documentación oficial del proyecto.

Pedido de un servidor con CogVideoX-5b mediante API

Para instalar este software utilizando la API, siga esta instrucción.

question_mark
Is there anything I can help you with?
question_mark
AI Assistant ×