Saltar a contenido

Llama-3.3-70B

En este artículo

Información

Llama-3.3-70B: un modelo de lenguaje de alto rendimiento con 70 mil millones de parámetros para despliegue local a través de Ollama. El modelo requiere recursos informáticos potentes con al menos 53 GB de memoria de vídeo (NVIDIA A100/H100 o múltiples GPUs de consumo). El despliegue en Ubuntu 22.04 admite la computación distribuida y la integración con Open Web UI, proporcionando un control total de los datos y optimización del rendimiento.

Funcionalidades principales de Llama-3.3-70B

  • Arquitectura de alto rendimiento: el modelo tiene 70 mil millones de parámetros y está optimizado para procesar tareas complejas con una precisión inigualable mediante tecnologías modernas de computación distribuida;

  • Integración con Open Web UI: una interfaz web moderna disponible en el puerto 8080, que garantiza un control total sobre los datos, los recursos informáticos y los procesos de procesamiento;

  • Computación distribuida: soporte avanzado para configuraciones multi-tarjeta con equilibrado de carga automático entre múltiples GPUs;

  • Escalabilidad: la capacidad de escalar horizontalmente añadiendo GPUs adicionales para aumentar el rendimiento;

  • Rendimiento: uso de la tecnología LLAMA_FLASH_ATTENTION para optimizar los cálculos y acelerar el procesamiento de solicitudes;

  • Tolerancia a fallos: un sistema de recuperación automática garantiza un funcionamiento continuo.

  • Ejemplos de uso:

    • Atención al cliente: automatización de respuestas a las consultas de los usuarios;

    • Educación: creación de materiales educativos, asistencia en la resolución de problemas;

    • Marketing: generación de textos publicitarios, análisis de reseñas;

    • Desarrollo de software: creación y documentación de código.

Funcionalidades de implementación

ID Nombre del Software SO Compatible VM BM VGPU GPU CPU Mín. (Núcleos) RAM Mín. (GB) HDD/SSD Mín. (GB) Dominio Personalizado Activo
253 Llama-3.3-70B Ubuntu 22.04 - - + + 4 64 - No PEDIR

Información

Para obtener información sobre las funcionalidades de implementación de este software, consulte este enlace.

  • El servidor Ollama carga y ejecuta el LLM en memoria;
  • Open WebUI se despliega como una aplicación web conectada al servidor Ollama;
  • Los usuarios interactúan con el LLM a través de la interfaz web de Open WebUI, enviando solicitudes y recibiendo respuestas;
  • Todos los cálculos y el procesamiento de datos ocurren localmente en el servidor. Los administradores pueden configurar el LLM para tareas específicas mediante las herramientas de OpenWebUI.

Requisitos del sistema y especificaciones técnicas

  • Acelerador gráfico con soporte CUDA (una de las opciones, puede ser mejor):

    • 1x NVIDIA H100
    • 2x NVIDIA A100 (48 GB de memoria de vídeo cada una)
    • 2x NVIDIA RTX 5090 (32 GB de memoria de vídeo cada una)
    • 2x NVIDIA A6000 (48 GB de memoria de vídeo cada una)
    • 3x NVIDIA RTX 4090 (24 GB de memoria de vídeo cada una)
    • 3x NVIDIA A5000 (24 GB de memoria de vídeo cada una)
  • Espacio en disco: SSD de tamaño suficiente para el sistema y el modelo;

  • Software: controladores NVIDIA y CUDA;

  • Uso de memoria de vídeo: 53 GB con un contexto de 2K tokens;

  • Monitorización del sistema: comprobación exhaustiva del estado de los controladores, contenedores y la temperatura de la GPU.

Primeros pasos tras implementar Llama-3.3-70B

Tras el pago, se enviará un correo electrónico a la dirección de correo registrada notificándole que el servidor está listo para trabajar. Incluirá la dirección IP del VPS, así como la información de inicio de sesión y Contraseña para conectarse al servidor y un enlace para acceder a OpenWebUI. Los clientes de nuestra empresa gestionan el equipo a través de el panel de gestión del servidor y APIInvapi.

  • Los datos de autenticación para acceder al sistema operativo del servidor (por ejemplo, mediante SSH) se le enviarán en el correo electrónico recibido.

  • Enlace para el acceso al panel de control de Ollama con la interfaz web Open WebUI: bajo la etiqueta webpanel en la pestaña Configuration >> Tags del panel de gestión de Invapi. El enlace exacto con el formato https://llama<Server_ID_from_Invapi>.hostkey.in se envía por correo electrónico tras la entrega del servidor.

Tras hacer clic en el enlace de la etiqueta webpanel, se abrirá una ventana de inicio de sesión Get started with Open WebUI, donde deberá crear un nombre de cuenta de administrador, correo electrónico y Contraseña para su chatbot, y luego presionar el botón Create Admin Account:

Atención

Tras registrar al primer usuario, el sistema le asigna automáticamente un rol de administrador. Para garantizar la seguridad y el control sobre el proceso de registro, todas las solicitudes de registro posteriores deben ser aprobadas en OpenWebUI desde la cuenta de administrador.

Nota

Puede encontrar información detallada sobre cómo trabajar con el panel de control de Ollama con Open WebUI en el artículo AI Chatbot on Your Own Server.

Nota

Para un rendimiento óptimo, se recomienda utilizar GPUs con más de los 16 GB de memoria de vídeo mínimos requeridos. Esto garantiza un búfer para procesar contextos más grandes y solicitudes paralelas. Puede encontrar información detallada sobre la configuración principal de Ollama y Open WebUI en la documentación para desarrolladores de Ollama y en la documentación para desarrolladores de Open WebUI.

Pedir un servidor con Llama-3.3-70B mediante API

Para instalar este software utilizando la API, siga estas instrucciones.

question_mark
Is there anything I can help you with?
question_mark
AI Assistant ×