IA de alto rendimiento: vLLM y Qwen VLM en producción

El despliegue de una ia de alto rendimiento requiere el dominio de herramientas de orquestación de inferencia como vLLM, que utiliza PagedAttention para maximizar el rendimiento. En este curso, se aborda la integración de modelos multimodales avanzados como Qwen VLM, permitiendo que los sistemas no solo procesen texto, sino que comprendan información visual con alta precisión. Por lo tanto, el enfoque principal es eliminar los cuellos de botella en la memoria de video y reducir el tiempo de respuesta en entornos productivos. El objetivo es alcanzar una eficiencia técnica que permita escalar soluciones de IA minimizando los costes de computación.

IA de alto rendimiento (vLLM & Qwen VLM)

Arquitectura de una ia de alto rendimiento

En primer lugar, comprender el funcionamiento de vLLM es esencial para cualquier arquitecto de sistemas modernos. Los alumnos aprenden a gestionar la memoria KV-Cache para permitir un flujo de tokens constante y sin latencia excesiva. Por este motivo, el contenido detalla la configuración de motores de inferencia para ia de alto rendimiento utilizando arquitecturas de atención optimizadas. Asimismo, se explora el despliegue de Qwen VLM para tareas de comprensión de imágenes y documentos complejos. Además de esto, se explica cómo la cuantización de modelos (AWQ o GPTQ) permite ejecutar modelos masivos en hardware más accesible. En consecuencia, se democratiza el acceso a capacidades de visión artificial de última generación. Por otra parte, se estudian los benchmarks de rendimiento para comparar diferentes backends de ejecución. De igual importancia es el aprendizaje sobre el servicio de APIs compatibles con OpenAI para facilitar la integración. En definitiva, el uso de estas tecnologías asegura un despliegue de IA robusto y escalable.

Aplicación práctica y escenarios reales

En cuanto a la implementación técnica, los participantes resolverán casos de optimización de throughput mediante el batching continuo de vLLM. Deberán diseñar flujos de trabajo donde Qwen VLM procese feeds de video en tiempo real para la extracción de metadatos. Por lo tanto, se practican dinámicas de ajuste de parámetros de inferencia para equilibrar precisión y velocidad. Los alumnos configuran contenedores Docker optimizados para GPU con drivers NVIDIA específicos para aceleración de ia de alto rendimiento. Adicionalmente, los escenarios incluyen la creación de sistemas de RAG multimodal donde la imagen aporta contexto crítico a la respuesta del modelo. Por otro lado, el curso ofrece soluciones para la monitorización de latencia y uso de VRAM en producción. Asimismo, se exploran técnicas de despliegue en nubes públicas como AWS o Google Cloud utilizando instancias aceleradas. En relación con la escalabilidad, se abordan casos de balanceo de carga entre múltiples nodos GPU. Por último, cada taller refuerza la capacidad de evaluar críticamente el coste por token de cada arquitectura. Así se garantiza que la solución sea técnica y económicamente viable.

Conclusión sobre la ia de alto rendimiento

En resumen, este programa técnico sitúa al profesional en la vanguardia del despliegue de modelos generativos. Al finalizar el curso, el estudiante dominará la infraestructura necesaria para sostener una ia de alto rendimiento bajo condiciones de alta demanda. Podrá implementar asistentes visuales y conversacionales que superen las limitaciones de los métodos tradicionales de inferencia. Debido a la rápida evolución de los modelos Qwen y las herramientas de servicio, estos conocimientos son vitales para mantener la competitividad tecnológica. Por consiguiente, se logra un equilibrio entre la potencia bruta de los modelos y la eficiencia operativa. En conclusión, la maestría en vLLM y Qwen VLM es el estándar de oro para la ingeniería de IA actual.

¿Eres docente?

¿Quieres saber más?

Bonificable hasta el 100 % para empresas

Duración30 horas

ModalidadAula virtual

TecnologíaCloud Computing, Inteligencia Artificial, Programación

¿Qué se aprenderá?

Objetivos del curso

  • Entender los cuellos de botella de la inferencia y cómo optimizarlos con vLLM (gestión de memoria y batching).
  • Desplegar un servidor de inferencia y exponerlo como API compatible con OpenAI.
  • Trabajar con modelos multimodales (VLM) para análisis de imágenes y documentos.
  • Aplicar cuantización para ejecutar modelos grandes en GPUs moderadas (enfoque práctico).
  • Integrar el modelo en scripts y aplicaciones (consumo por API).
  • Construir un flujo de agente: entrada (imagen) → análisis VLM → decisión → acción (JSON).

¿Por qué este curso?

Una formación con impacto real y medible

Explora nuestro catálogo de cursos diseñados para profesionales y empresas que buscan dominar las tecnologías más demandadas.

Cifras de éxito

"Este curso nos ha ayudado a tener éxito en nuestro sector."

Te ofrecemos la mejor formación.
Cifras de éxito
86%

de los participantes aplicaron con éxito los conocimientos obtenidos.
Cifras de éxito
75%

de los participantes obtuvieron nuevas oportunidades laborales.

Testimonios

"Necesitábamos formar a un equipo con niveles muy distintos y sin parar la operativa. ExA adaptó el temario a lo que hacemos de verdad y ajustó el calendario a nuestros turnos. Es lo que buscábamos y no encontrábamos en un curso de catálogo."

Roberto Pérez

CEO de Blabla
"Gracias a la formación recibida en Exa Formación, nuestro equipo ha adquirido habilidades clave en inteligencia artificial y ciberseguridad, mejorando significativamente nuestra competitividad."

Laura Sánchez

CEO de Invbit
Cliente Santander – formación tecnológica para empresas
Cliente BBVA – formación tecnológica para empresas
Cliente Minsait – formación tecnológica para empresas
Cliente Indra – formación tecnológica para empresas
Cliente Accenture – formación tecnológica para empresas
Cliente Red Eléctrica de España – formación tecnológica para empresas

Contenidos

Temario

A continuación detallamos todos los módulos impartidos en este curso. Si tiene alguna duda o no aparece, contacte con nosotros.

  • Módulo 1Arquitectura de Inferencia y Aceleración
  • Módulo 2Modelos Multimodales (VLM) con Qwen2-VL
  • Módulo 3Resto de módulos

Arquitectura de Inferencia y Aceleración

6 horas

Optimización de latencia y VRAM mediante vLLM y el concepto de PagedAttention. Implementación de batching continuo para gestionar múltiples usuarios y despliegue práctico de servidores de inferencia en entornos GPU (T4).

Modelos Multimodales (VLM) con Qwen2-VL

8 horas

Integración de vision encoders con LLMs para tareas de OCR, descripción de escenas y extracción de datos. Aplicación de cuantización (AWQ/FP8) para ejecutar modelos de gran escala en hardware de consumo y análisis técnico de documentos complejos.

Resto de módulos

Resto de horas

Si quiere conocer el resto de módulos, contacte con nosotros.

Metodología

Aprendizaje basado en la práctica

Cada módulo combina teoría y ejercicios aplicados

Implementación técnica centrada en el rendimiento de inferencia, cuantización de modelos y despliegue escalable en infraestructuras GPU.

Público objetivo

Formación para profesionales actuales

Enfocado a quienes buscan dominar herramientas tecnológicas modernas

Ingenieros de Machine Learning, desarrolladores de IA y arquitectos de soluciones que buscan maximizar el rendimiento de modelos de lenguaje y visión.

FAQ

Resolvemos tus dudas sobre la formación

Aclaramos las dudas más comunes sobre el curso, desde los requisitos previos hasta la metodología y el soporte disponible, para asegurarte de que estés completamente preparado para aprovechar al máximo esta formación.

Icono de empresa

¿Se puede personalizar la formación para mi empresa?

Sí. Adaptamos contenidos, duración y ritmo a las necesidades de tu equipo y a vuestros objetivos. Cuéntanos qué necesitáis y preparamos una propuesta a medida.
Icono de innovación

¿Qué nivel previo necesito?

Cada curso indica sus requisitos en su propia ficha. Si tienes dudas sobre si es tu nivel, escríbenos y te orientamos antes de reservar.
Icono de formación

¿En qué modalidad se imparte?

En aula virtual: clases en directo con formador, por videoconferencia. No es formación grabada. Si necesitas sesiones presenciales, consúltanos.
Icono de certificado

¿Se entrega algún certificado?

Sí. Al finalizar se entrega un certificado de aprovechamiento con el contenido y las horas del curso.

Otros cursos

Cursos especializados para impulsar tu negocio

Explora nuestro catálogo de cursos diseñados para profesionales y empresas que buscan dominar las tecnologías más demandadas.

Especialista en Marketing Cloud: Email y Journey Builder de Salesforce (IFCT97)

Duración40 horas

ModalidadAula virtual

El email sigue siendo el canal con mejor retorno del marketing digital, pero solo cuando se trabaja con datos ordenados, segmentos bien construidos y recorridos automatizados. […]

Creación de Proyectos Educativos de Centros Socioculturales (SSCB0016)

Duración30 horas

ModalidadAula virtual

Un centro sociocultural sin proyecto educativo es un edificio con actividades; con él, se convierte en una herramienta de intervención social y desarrollo comunitario. Este curso […]

Elaboración de Materiales y Medios Didácticos: Nuevas Tecnologías y Control de Calidad (SSCE0080)

Duración20 horas

ModalidadAula virtual

Un buen material didáctico no aparece por casualidad: se planifica, se diseña por etapas y se somete a control de calidad. Este curso de elaboración de […]

Los Proyectos como Técnica Didáctico-Pedagógica en Educación Infantil (SSCE0087)

Duración50 horas

ModalidadAula virtual

El trabajo por proyectos en educación infantil convierte la curiosidad de los niños en el motor de la programación del aula: se investiga un tema real […]

Coordinación de Proyectos Pedagógicos y de Ocio (SSCE0166)

Duración40 horas

ModalidadAula virtual

Coordinar un proyecto pedagógico o de ocio es mucho más que cuadrar horarios: exige planificar por fases, evaluar con método, seguir indicadores y mantener motivado a […]

Fabricación Aditiva de Impresión 3D (IFCT98)

Duración30 horas

ModalidadAula virtual

La fabricación aditiva ha pasado del prototipo a la producción: hoy se imprimen desde utillajes industriales hasta piezas finales en salud, automoción o construcción. Este curso […]

Blue Team: Seguridad Defensiva (IFCT155)

Duración50 horas

ModalidadAula virtual

La seguridad defensiva es la mitad silenciosa de la ciberseguridad: mientras los equipos ofensivos buscan huecos, el Blue Team los cierra, vigila los sistemas y responde […]

Seguridad en Servidores Linux (LPIC-3 303: Linux Enterprise Professional Security) (IFCT99)

Duración48 horas

ModalidadAula virtual

Asegurar un servidor Linux exige dominar varias capas a la vez: la criptografía que protege los datos, el bastionado del propio sistema, el control de quién […]

Inteligencia Artificial Aplicada a la Empresa (IFCT163PO)

Duración250 horas

ModalidadAula virtual

La inteligencia artificial ha dejado de ser un asunto de laboratorio para convertirse en una herramienta de gestión: predice la demanda, segmenta clientes, recomienda productos y […]

Monta y Configura tu Propia Impresora 3D (IFCT88)

Duración30 horas

ModalidadAula virtual

Pocas formas hay de entender una tecnología como construirla con las propias manos. Este curso de montaje de impresoras 3D propone eso: montar la máquina pieza […]

Competencias Digitales para la Ciudadanía: Nivel Básico (Accesible Doble A) (IFCT150)

Duración60 horas

ModalidadAula virtual

Manejarse con soltura en el entorno digital es hoy una condición básica para trabajar y para ejercer la ciudadanía. El curso de competencias digitales nivel básico, […]

Competencias Digitales para la Ciudadanía: Nivel Intermedio (Accesible Doble A) (IFCT151)

Duración60 horas

ModalidadAula virtual

Entre saber usar lo básico y dominar el entorno digital hay un nivel intermedio que marca la diferencia en el trabajo diario. El curso de competencias […]

Descubre cómo podemos ayudarte a mejorar las habilidades digitales de tus empleados.

Si eres un experto en tecnología y quieres enseñar, únete a nuestra red de formadores.

Ir al contenido