Table of Contents
Resumen
Qwen3.8 27B puede ejecutarse localmente sobre hardware AMD mediante llama.cpp, LM Studio y Lemonade, con hasta 51,8 tokens por segundo en pruebas preliminares de AMD.
Ryzen AI Max+ 395 y Radeon AI PRO R9700 ejecutan el modelo de 27B desde el primer día mediante llama.cpp, LM Studio y Lemonade. AMD ofrece soporte desde el primer día para ejecutar Qwen3.8 27B localmente en sistemas Ryzen AI Max+ y en una Radeon AI PRO R9700 de 32 GB mediante herramientas como llama.cpp y LM Studio. El modelo necesita aproximadamente 24 GB de VGM o VRAM para funcionar cómodamente.
Aspectos clave
- AMD anunció soporte Day 0 para Qwen3.8 27B el 14 de agosto de 2026.
- Es un modelo denso de 27.000 millones de parámetros orientado, según AMD, a programación, trabajo, investigación y cargas de IA de horizonte prolongado.
- Puede ejecutarse en sistemas AMD Ryzen AI Max+ o con una sola Radeon AI PRO R9700 de 32 GB.
- AMD recomienda disponer de más de 24 GB de VGM o VRAM.
- Las pruebas preliminares alcanzaron hasta 24,5 tokens/s en Ryzen AI Max+ 395.
- Una Radeon AI PRO R9700 alcanzó hasta 51,8 tokens/s en el benchmark de AMD.
- Las pruebas utilizaron
llama.cpp, Windows, backend Vulkan y Multi-Token Prediction. - LM Studio permite descargar y utilizar el modelo mediante interfaz gráfica sin necesidad de escribir código.
- Lemonade permite integrar inferencia local dentro de aplicaciones sin que el desarrollador tenga que mantener individualmente cada backend de hardware.
Los modelos avanzados empiezan a caber en la PC
Lima, Perú, 15 de agosto de 2026.— Hasta hace pocos años, ejecutar un modelo de lenguaje con decenas de miles de millones de parámetros implicaba acceder a servidores especializados o contratar capacidad en la nube. Ese límite se está desplazando. AMD anunció soporte desde el primer día para Qwen3.8 27B, permitiendo ejecutar el nuevo modelo directamente sobre determinadas PCs y estaciones de trabajo equipadas con Ryzen AI Max+ o Radeon AI PRO. La idea tiene una importancia mayor que el benchmark aislado. Si un desarrollador puede descargar un modelo, ejecutarlo, probar agentes y conectarlo con una aplicación sobre su propia máquina, la PC empieza a convertirse en una pequeña infraestructura privada de IA. AMD lleva meses impulsando precisamente esa tesis mediante el concepto de Agent Computer: sistemas capaces de ejecutar modelos y agentes localmente en lugar de depender permanentemente de recursos cloud.
¿Qué es Qwen3.8 27B?
AMD describe Qwen3.8 27B como un modelo denso de 27.000 millones de parámetros perteneciente a la familia Qwen. La generación mantiene su orientación hacia:
- programación;
- tareas profesionales;
- investigación;
- trabajos complejos de largo horizonte;
- aplicaciones de IA locales.
La palabra denso es importante. En un modelo denso, prácticamente el conjunto completo de parámetros participa durante la inferencia, a diferencia de las arquitecturas Mixture-of-Experts —MoE—, donde solo una fracción de los parámetros se activa para cada token. Esto suele aumentar las exigencias de memoria y cómputo. Por eso AMD señala que Qwen3.8 27B necesita alrededor de 24 GB de memoria gráfica disponible para trabajar con comodidad.
24 GB marcan una nueva frontera para la IA local
La memoria se está convirtiendo en una de las variables más importantes de la IA ejecutada sobre dispositivos. Un LLM debe mantener sus pesos y diferentes estructuras necesarias para inferencia dentro de la memoria disponible. Si el modelo no cabe, el sistema necesita:
- reducir precisión mediante cuantización;
- trasladar parte de los datos hacia RAM;
- distribuir el modelo;
- utilizar un dispositivo con mayor capacidad.
AMD indica que Qwen3.8 27B puede ejecutarse sobre hardware compatible con más de 24 GB de VGM o VRAM. Esto abre dos caminos diferentes. Ryzen AI Max+ puede utilizar una porción de su memoria unificada como memoria gráfica variable. Radeon AI PRO R9700 dispone de 32 GB de GDDR6 dedicados, con 640 GB/s de ancho de banda y arquitectura RDNA 4. En ambos casos, el objetivo es mantener el modelo suficientemente cerca del procesador gráfico para evitar cuellos de botella provocados por movimientos constantes de información.
Ryzen AI Max+ 395 alcanza hasta 24,5 tokens por segundo
AMD realizó sus pruebas iniciales sobre un GMKtec EVO X2 AI Mini PC equipado con Ryzen AI Max+ 395 y 128 GB de memoria de sistema. La memoria gráfica variable estaba configurada en 64 GB. El modelo alcanzó hasta: 24,5 tokens por segundo. La prueba se realizó sobre Windows 11 Pro 25H2 utilizando llama.cpp, backend Vulkan y MTP configurado con cuatro tokens de borrador. AMD promedió tres o más ejecuciones. La cifra debe entenderse como un benchmark preliminar de generación. No significa que cualquier aplicación responderá permanentemente a 24,5 tokens/s: longitud del contexto, prompt, cuantización, configuración y el software a utilizarse pueden modificar considerablemente el resultado.
Radeon AI PRO R9700 supera los 50 tokens/s
Sobre una estación equipada con Radeon AI PRO R9700 de 32 GB, AMD obtuvo un resultado considerablemente mayor: hasta 51,8 tokens por segundo. El sistema de prueba utilizó además:
- AMD Ryzen 9 9950X;
- 64 GB de memoria;
- Windows 11 Pro 25H2;
- AMD Software Adrenalin 26.7.1;
llama.cpp;- backend Vulkan;
- MTP configurado en dos tokens de borrador.
La R9700 ha sido diseñada específicamente para cargas profesionales de IA local y dispone de 32 GB GDDR6, 128 aceleradores de IA y arquitectura RDNA 4. Ese volumen de memoria es particularmente relevante para LLM, donde muchas cargas están limitadas tanto por capacidad como por ancho de banda.
Tokens por segundo: cómo interpretar la métrica
Los modelos de lenguaje no generan una respuesta completa de una sola vez. Construyen texto token por token. Un token puede representar una palabra completa, parte de una palabra, un signo o una combinación de caracteres. Por eso, la métrica tokens por segundo —tok/s— indica aproximadamente a qué velocidad el modelo va generando la respuesta. Cuanto mayor sea el valor, más fluida puede sentirse una conversación interactiva. Pero tokens/s no mide por sí solo:
- inteligencia del modelo;
- precisión;
- calidad de razonamiento;
- tiempo necesario para procesar inicialmente un prompt;
- consumo de energía;
- latencia completa del sistema.
Es una métrica de throughput de generación, no una puntuación de calidad.
MTP ayuda a generar varios candidatos por ciclo
Las pruebas de AMD utilizan Multi-Token Prediction —MTP—. En lugar de limitar la inferencia a predecir estrictamente un único token futuro cada vez, MTP puede proponer varios candidatos que posteriormente son verificados por el modelo principal. AMD utiliza esta técnica como una modalidad de decodificación especulativa destinada a reducir la latencia efectiva y aumentar el throughput manteniendo la corrección mediante verificación. Para Qwen3.8 27B, AMD recomienda:
- MTP = 4 en Ryzen AI Max+;
- MTP = 2 en Radeon AI PRO R9700.
Esta diferencia demuestra otro aspecto de la IA local: obtener buen rendimiento no depende solamente del silicio. También requiere optimización del stack de inferencia.
llama.cpp sigue siendo una pieza central del ecosistema local
El soporte Day 0 se apoya en llama.cpp, uno de los proyectos abiertos más utilizados para ejecutar modelos de lenguaje en CPUs y GPU. AMD lo describe como un framework de inferencia ligero escrito en C/C++ que soporta cuantización y diferentes plataformas de hardware. Su importancia para la IA local proviene precisamente de esa portabilidad. Un desarrollador puede utilizar el mismo ecosistema para probar modelos sobre:
- desktops;
- laptops;
- workstations;
- mini PCs;
- diferentes configuraciones de GPU.
En las pruebas de Qwen3.8 27B, AMD utiliza específicamente el backend Vulkan bajo Windows. Esto también merece una precisión: el benchmark comunicado no corresponde a inferencia ejecutada sobre la NPU XDNA del Ryzen AI Max+. La aceleración utilizada para estos resultados proviene fundamentalmente del procesamiento gráfico mediante Vulkan.
LM Studio baja la barrera de entrada
No todo usuario que quiera experimentar con un LLM local quiere compilar herramientas o escribir comandos. Para ellos, AMD destaca LM Studio. La aplicación proporciona una interfaz gráfica que permite:
- localizar el modelo;
- descargarlo;
- cargarlo en memoria;
- introducir prompts;
- probar workflows localmente.
AMD mantiene además guías específicas para ejecutar y servir modelos mediante LM Studio sobre hardware AMD utilizando backends Vulkan y ROCm. Para Qwen3.8 27B, AMD recomienda desactivar Try mmap y configurar correctamente MTP para obtener el rendimiento esperado. Esto significa que la IA local está dejando de ser exclusivamente terreno de investigadores y desarrolladores avanzados.
Lemonade apunta hacia el siguiente paso: integrar la IA en aplicaciones
Ejecutar un chatbot local es solo el comienzo. El verdadero cambio llega cuando una aplicación puede utilizar un modelo local como una parte más de su arquitectura. Ahí entra Lemonade. AMD la describe como una plataforma local-first que proporciona una interfaz común sobre diferentes motores y puede decidir cómo utilizar CPU, GPU y NPU según el hardware disponible. Una aplicación podría, por ejemplo, conectarse localmente a Qwen3.8 para:
- resumir documentos;
- generar código;
- consultar una base de conocimientos;
- coordinar un agente;
- clasificar información;
- mantener conversaciones privadas.
El desarrollador no necesita construir por separado toda la capa de inferencia específica de cada plataforma. Lemonade funciona como intermediario.
De un modelo local a una aplicación agéntica
Esta es probablemente la parte más interesante para nuestra cobertura. Un modelo descargado en una PC puede ser simplemente un chatbot. Pero también puede convertirse en el motor de un agente local. Si añadimos herramientas, memoria, acceso autorizado a documentos y workflows, el sistema podría ejecutar procesos sin enviar necesariamente cada solicitud a la nube. AMD está posicionando precisamente los sistemas Ryzen AI Max como plataformas para esa transición hacia Agent Computers. Su plataforma Ryzen AI Halo admite herramientas como PyTorch, vLLM, llama.cpp, Ollama, ComfyUI y LM Studio y está orientada al desarrollo de aplicaciones generativas y agénticas locales. Qwen3.8 27B añade otra opción de modelo dentro de ese ecosistema.
¿Por qué importa ejecutar IA localmente?
La nube conserva ventajas enormes:
- escalabilidad;
- modelos extremadamente grandes;
- mantenimiento centralizado;
- acceso desde diferentes dispositivos;
- infraestructura especializada.
Pero la ejecución local ofrece atributos diferentes. Puede reducir:
- latencia, porque determinadas solicitudes no necesitan recorrer Internet.
- Dependencia de conectividad, porque algunos workflows pueden continuar ejecutándose sin conexión.
- Transferencia de datos, porque determinada información puede procesarse en el equipo.
- Costo marginal de inferencia cloud, una vez adquirido el hardware y dentro de sus límites.
Y puede incrementar el control sobre cómo se manejan determinados datos. Pero existe una precisión indispensable: local no significa automáticamente privado o seguro. Una aplicación local puede seguir enviando telemetría, utilizar servicios externos, contener malware o tener configuraciones inseguras. La privacidad depende de toda la arquitectura, no únicamente del lugar donde se ejecuta el modelo.
Day 0: disponibilidad inmediata, no optimización terminada
AMD está enfatizando especialmente el concepto Day 0 support. Significa que la compañía busca que un modelo nuevo pueda utilizarse sobre su hardware desde el momento del lanzamiento, en lugar de esperar semanas o meses a recibir compatibilidad. Para un desarrollador, esto reduce una forma importante de fricción: modelo nuevo → soporte de hardware → pruebas → integración. Pero Day 0 no significa que el software haya alcanzado ya su máximo rendimiento. AMD describe expresamente los resultados de Qwen3.8 como preliminares y señala que continúan las optimizaciones del modelo y del software.
Esta distinción es importante para evaluar correctamente los benchmarks. El número de hoy podría cambiar con controladores, kernels y runtimes posteriores.
La memoria empieza a ser tan importante como los TOPS
Durante los primeros años de las AI PCs, buena parte del marketing se concentró en TOPS. La llegada de modelos locales más grandes muestra que existe otra variable crítica: ¿cabe el modelo dentro de la memoria disponible? Un sistema puede disponer de una NPU muy potente y, aun así, no resultar adecuado para determinados LLM si carece de la capacidad de memoria necesaria. Ryzen AI Max adopta memoria unificada precisamente para ofrecer una reserva considerable que puede asignarse al procesamiento gráfico. AMD ya ha demostrado en otras cargas que Ryzen AI Max+ puede dedicar hasta 96 GB de memoria como VGM en configuraciones de 128 GB, permitiendo ejecutar modelos considerablemente mayores. La nueva generación Ryzen AI Max PRO 400 eleva todavía más esa estrategia, con configuraciones anunciadas de hasta 192 GB de memoria unificada. La batalla de la IA local será, por tanto: cómputo + memoria + ancho de banda + software.
Una Radeon profesional permite otra clase de estación local
La Radeon AI PRO R9700 sigue una estrategia distinta. En lugar de memoria compartida con el sistema, proporciona 32 GB de VRAM GDDR6 dedicada. AMD posiciona la tarjeta específicamente para:
- inferencia local;
- desarrollo de IA;
- procesamiento del lenguaje;
- generación visual;
- fine-tuning;
- cargas intensivas en memoria.
Su diseño de doble slot permite además configuraciones con múltiples GPU en estaciones profesionales. Para Qwen3.8 27B, una sola R9700 es suficiente según acota AMD. Ese detalle es importante: no estamos hablando de un clúster ni de un servidor, sino de una tarjeta instalada en una workstation.
Qué significa para desarrolladores latinoamericanos
Esta tendencia puede ser particularmente relevante para desarrolladores, universidades, startups y equipos pequeños que necesitan experimentar con IA sin mantener constantemente una instancia cloud de GPU. Una estación local puede funcionar como:
- entorno de prototipado;
- servidor personal de inferencia;
- laboratorio de agentes;
- plataforma de programación asistida por IA;
- entorno privado para trabajar con información interna.
No sustituirá todas las cargas cloud. Pero amplía la cantidad de trabajos que pueden realizarse directamente sobre infraestructura propia. Eso democratiza una parte del acceso al cómputo avanzado, aunque el costo del hardware profesional siga siendo una barrera.
Más contexto
Es importante subrayar cuatro advertencias con respecto a las cifras y estimados del anuncio.
- 24,5 tokens/s y 51,8 tokens/s: son resultados preliminares proporcionados por AMD, no benchmarks independientes.
- Configuraciones diferentes: Ryzen AI Max+ 395 fue probado con 128 GB de RAM y 64 GB asignados como VGM; la Radeon R9700 utilizó una workstation con Ryzen 9 9950X y 64 GB de RAM.
- MTP: los resultados utilizan optimización Multi-Token Prediction —cuatro tokens en Ryzen y dos en Radeon—, por lo que no deberían compararse directamente con pruebas realizadas sin esa técnica.
- Day 0: AMD reconoce que continúa optimizando el modelo y el software, por lo que el rendimiento puede evolucionar posteriormente.
Datos citables
- Qwen3.8 27B es un modelo denso de 27.000 millones de parámetros.
- AMD recomienda aproximadamente 24 GB o más de VGM/VRAM para ejecutarlo cómodamente.
- Ryzen AI Max+ 395 alcanzó hasta 24,5 tokens/s en las pruebas preliminares de AMD.
- Radeon AI PRO R9700 alcanzó hasta 51,8 tokens/s.
- Radeon AI PRO R9700 integra 32 GB GDDR6 y un ancho de banda máximo de 640 GB/s.
- La R9700 incorpora 128 aceleradores de IA y 64 Compute Units bajo arquitectura RDNA 4.
- Las pruebas utilizaron
llama.cppsobre Vulkan en Windows. - AMD mantiene soporte de LM Studio tanto mediante Vulkan como mediante ROCm en hardware compatible.
Preguntas y respuestas para comprender la IA local
¿Qué significa que Qwen3.8 sea un modelo de 27B?
Significa que posee aproximadamente 27.000 millones de parámetros aprendidos durante su entrenamiento. En este caso se trata de una arquitectura densa.
¿Qué significa ejecutar el modelo localmente?
Que la inferencia se realiza sobre el propio equipo en lugar de enviar cada prompt a un servidor remoto. Descargar el modelo o algunas herramientas sí puede requerir conexión a Internet.
¿Qué diferencia existe entre VGM y VRAM?
VRAM es memoria dedicada a una GPU discreta. VGM —Variable Graphics Memory— permite reservar una parte de la memoria unificada del sistema para que funcione como memoria gráfica en determinadas plataformas AMD.
¿24,5 tokens/s es rápido?
Puede proporcionar una experiencia interactiva fluida para numerosos usos de texto, pero la sensación final depende también del tiempo de procesamiento inicial, longitud del contexto y complejidad del workflow.
¿El Ryzen AI Max+ ejecuta Qwen3.8 sobre su NPU?
El benchmark comunicado por AMD fue realizado mediante llama.cpp y backend Vulkan, por lo que estos resultados están asociados principalmente con el procesamiento gráfico, no con la NPU.
¿Qué aporta LM Studio?
Una interfaz gráfica para descargar, gestionar, ejecutar y servir modelos locales sin necesidad de configurar manualmente todo el stack de inferencia. AMD mantiene soporte específico para sus plataformas.
¿Qué aporta Lemonade?
Ofrece una capa local de inferencia que abstrae parte de la complejidad del hardware y permite integrar modelos como Qwen3.8 dentro de aplicaciones mediante interfaces conocidas.
Knowledge Layer | Glosario
- LLM —Large Language Model—: modelo de inteligencia artificial entrenado para comprender y generar lenguaje mediante grandes cantidades de parámetros.
- Parámetro: valor aprendido por un modelo durante su entrenamiento y utilizado posteriormente para producir inferencias.
- Modelo denso: arquitectura en la que prácticamente todos los parámetros relevantes participan durante cada paso de inferencia.
- Token: unidad elemental de texto utilizada por un modelo; puede representar una palabra, parte de una palabra o determinados caracteres.
- Tokens por segundo: métrica que indica la velocidad con la que un modelo genera tokens durante la fase de salida.
- VRAM: memoria dedicada instalada junto a una GPU discreta.
- VGM —Variable Graphics Memory—: parte de la memoria unificada que puede asignarse dinámicamente al procesamiento gráfico en plataformas compatibles de AMD.
- MTP —Multi-Token Prediction—: técnica que permite anticipar múltiples tokens candidatos para acelerar la generación mediante verificación posterior.
- llama.cpp: framework abierto de inferencia para ejecutar LLM sobre CPU y GPU con soporte de formatos cuantizados y múltiples plataformas.
- Day 0 Support: disponibilidad de compatibilidad desde el momento inicial del lanzamiento de un modelo, antes de que finalicen necesariamente todas las optimizaciones posteriores.
¿Por qué es importante?
La posibilidad de ejecutar un modelo denso de 27.000 millones de parámetros sobre una PC muestra cuánto se está desplazando la frontera de la inteligencia artificial local. Para desarrolladores, esto significa experimentar con modelos avanzados y agentes directamente sobre infraestructura propia, reduciendo dependencia permanente de servicios cloud.
Visión Estratégica
La IA local está pasando de modelos pequeños diseñados para tareas puntuales hacia sistemas capaces de ejecutar LLM de decenas de miles de millones de parámetros. En esa transición, el diferenciador de la PC deja de ser únicamente CPU o TOPS: memoria, ancho de banda, GPU y software de inferencia empiezan a funcionar como una sola arquitectura. Qwen3.8 27B muestra esa convergencia. La nube continuará siendo indispensable para modelos gigantes y escalabilidad masiva, pero la PC comienza a recuperar una función histórica: convertirse nuevamente en el lugar donde el desarrollador posee, ejecuta y controla directamente su entorno de computación.
Acerca de AMD
Advanced Micro Devices desarrolla CPU, GPU, aceleradores y plataformas para computación personal, profesional, data centers e inteligencia artificial. La compañía cotiza en Nasdaq bajo el símbolo AMD, según su información oficial para inversionistas.
Fuente técnica principal sugerida
AMD — Run Qwen 3.8 27B on AMD Ryzen AI Max Agentic PCs and Radeon GPUs
Tu Opinión Nos Importa ツ
Durante años dimos por sentado que los modelos de IA más capaces tendrían que vivir en enormes centros de datos. Ahora, un modelo de 27.000 millones de parámetros puede ejecutarse dentro de una PC o workstation.
¿Preferirías utilizar un asistente de IA potente directamente en tu computadora aunque fuera algo más lento, si eso te permitiera mantener tus documentos y procesos localmente?
¿Crees que dentro de pocos años la capacidad para ejecutar agentes de IA será tan importante al elegir una PC como hoy lo son CPU, memoria o GPU?
Comparte tu perspectiva con la comunidad de IT/USERS® Magazine: #ItusersAwards2026 #SuperFan
Apoya al Periodismo Independiente

¿Te sirvió en algo este contenido?, ayúdanos a combatir la Desinformación, dona desde S/ 1.00 a nuestro PLIN 943-438-457

