This article is also available in English.
Read in EN →
Qwen 3.8-35B-A3B MoE Filtrado: Cómo Ejecutar IA de 35B en GPUs de 8GB-16GB y Ahorrar Miles de Euros en PYMEs (Agosto 2026)
Modelos IA
13 min ETA

Qwen 3.8-35B-A3B MoE Filtrado: Cómo Ejecutar IA de 35B en GPUs de 8GB-16GB y Ahorrar Miles de Euros en PYMEs (Agosto 2026)

IA4PYMES Logo

IA4PYMES

Research Team

Mientras la comunidad de desarrolladores celebraba la llegada del modelo denso Qwen 3.8-27B en Hugging Face y sus recientes versiones cuantizadas en GGUF por Unsloth, una actualización silenciosa en el repositorio oficial de ModelScope ms-swift ha desvelado el verdadero salto estratégico de Alibaba: el registro del modelo Qwen/Qwen3.8-35B-A3B.

El hallazgo, detectado en el commit ab726e9d445a6520a70df2c831177d46adb1f589, confirma que el equipo de Qwen prepara la liberación de un modelo basado en Mezcla de Expertos (MoE - Mixture of Experts) con 35.000 millones de parámetros totales donde solo se activan ~3.000 millones de parámetros por cada token generado (A3B = Active 3 Billion).

Para el tejido empresarial y las PYMEs que buscan soberanía tecnológica sin invertir en servidores de miles de euros, este modelo representa una ventaja operativa superior frente a los modelos densos tradicionales.

En este artículo analizamos la prueba técnica del commit filtrado, la física del cálculo MoE frente a modelos densos, los requisitos de hardware en VRAM/RAM y por qué este modelo democratiza los agentes de producción locales.


1. La evidencia técnica: El commit de ModelScope

La filtración no procede de un rumor anónimo, sino del repositorio oficial de herramientas de fine-tuning y despliegue de Alibaba (modelscope/ms-swift), donde se han añadido las definiciones de plantillas y cargadores específicos para la arquitectura MoE de Qwen 3.8:

Evidencia técnica en el commit de ModelScope

Como se observa en el código fuente de swift/model/models/qwen.py:

  • Se incorpora el identificador oficial Qwen/Qwen3.8-35B-A3B y su variante nativa en FP8.
  • Se utiliza el cargador Qwen3_5MoeLoader con la plantilla TemplateType.qwen3_8.
  • Se añade también el modelo insignia de alta escala Qwen/Qwen3.8-2.4T-A95B (2.4 trillones con 95B activos).

2. Denso vs. MoE: ¿Por qué 35B-A3B es revolucionario para PYMEs?

Para entender el impacto financiero y de rendimiento de este modelo, es necesario comprender la diferencia matemática entre un modelo denso y una arquitectura Mixture of Experts (MoE):

┌─────────────────────────────────────────────────────────────────────────┐
│                    COMPARATIVA DE ARQUITECTURA COMPUTACIONAL            │
├───────────────────────────────────┬─────────────────────────────────────┤
│ MODELO DENSO (QWEN 3.8-27B)       │ MODELO MOE (QWEN 3.8-35B-A3B)       │
├───────────────────────────────────┼─────────────────────────────────────┤
│ • 27.000M parámetros calculados   │ • 35.000M parámetros totales en VRAM│
│   por CADA token generado         │ • Solo ~3.000M parámetros activos   │
│ • Alto consumo de FLOPS por token │   por cada token generado           │
│ • Velocidad moderada (20-30 t/s)  │ • Coste computacional de modelo 3B  │
│ • Exige GPUs con gran ancho de bus│ • Velocidad ultra-rápida (60-90 t/s)│
└───────────────────────────────────┴─────────────────────────────────────┘

La ventaja del enrutamiento de expertos:

  1. Capacidad de conocimiento de 35B: El modelo tiene 35 billones de parámetros distribuidos en diferentes redes neuronales expertas (código, razonamiento matemático, extracción de datos, redacción legal).
  2. Velocidad de ejecución de un 3B: Un router dinámico selecciona únicamente los 2 o 3 expertos relevantes para responder a la consulta. Al generar cada token, tu tarjeta gráfica solo realiza las operaciones matemáticas equivalentes a un modelo diminuto de 3B.
  3. Throughput masivo en GPUs modestas: Mientras que un modelo denso de 27B satura los núcleos CUDA de una NVIDIA RTX 3060/4060 o RTX 4070 (8GB - 12GB - 16GB), el modelo 35B-A3B cuantizado en 4 bits genera texto a velocidades superiores a 60-80 tokens por segundo.

3. Matriz de Hardware y Requisitos para Empresas

Gracias a que la carga de cómputo por token es de solo 3B, el factor limitante ya no es la potencia del procesador gráfico, sino únicamente disponer de memoria suficiente para alojar los pesos del modelo:

Formato / CuantizaciónMemoria Total (VRAM + RAM)Velocidad EstimadaHardware Mínimo Recomendado
Q3_K_M (MoE)~14 GB70-90 tok/sGPU 12GB (RTX 3060/4070) o PC 24GB RAM
Q4_K_M (Estándar)~18-20 GB60-80 tok/s1x RTX 4080 (16GB) / RTX 4090 / Mac 32GB
Q5_K_M / Q6_K~23-26 GB50-70 tok/sMac Studio 36GB / 2x GPUs 16GB / 48GB RAM
FP8 Nativo~35 GB80-110 tok/s2x RTX 4090 (48GB VRAM) / Mac Studio 64GB

4. Casos de uso de alto rendimiento para PYMEs con Qwen 3.8-35B-A3B

┌──────────────────────────────────────────────────────────────┐
│           ARQUITECTURA DE AGENTES CON QWEN 3.8-35B-A3B       │
└──────────────────────────────┬───────────────────────────────┘
                               │
               ┌───────────────┴───────────────┐
               ▼                               ▼
     [Alto Rendimiento Local]       [Cero Coste por Token]
               │                               │
       ┌───────┴───────┐               ┌───────┴───────┐
       ▼               ▼               ▼               ▼
 [Atención Clientes] [Extracción ERP] [Agentes Código] [Normativa Fiscal]
 (Latencia <100ms)   (Bases SQL)      (DeepSeek-Harn) (VeriFactu RGPD)
  1. Atención al Cliente y Call Centers con Latencia Cero: La velocidad de más de 70 tokens/segundo permite integrar el modelo con sistemas de voz interactiva en tiempo real (Voice AI) sin pausas molestas para el usuario.
  2. Procesamiento Masivo de Facturación (VeriFactu): Extrae y valida NIFs, bases imponibles y líneas de pedido en cientos de facturas por minuto sin pagar un solo céntimo en APIs comerciales.
  3. Agentes Autónomos con DeepSeek Harness y Executor.sh: Al ejecutar bucles de llamadas a herramientas (tool calling loops), la alta velocidad de generación evita cuellos de botella en la ejecución de scripts en terminal.

5. Estrategia Híbrida: Cómo preparar tu infraestructura

Ante la inminente liberación de los pesos oficiales por parte de Alibaba, las empresas deben estructurar su pila tecnológica:

  • Paso 1 (Preparación de Pasarelas MCP): Configurar servidores de datos locales mediante protocolos estandarizados para que el modelo se conecte directamente al CRM o ERP interno.
  • Paso 2 (Segregación de Cargas): Mantener APIs como Gemini 3.7 Flash o GLM-5.3 para ingesta masiva de vídeo y PDFs de 1 millón de tokens, y delegar el 100% de las tareas recurrentes y confidenciales a Qwen 3.8-35B-A3B en local.

6. Siguientes pasos para tu empresa

La arquitectura Mixture of Experts (MoE) marca el fin de la dependencia forzosa de la nube para tareas de alta velocidad y volumen.

Reserva una Consultoría de Despliegue de IA Local con IA4PYMES → Diseñamos e instalamos servidores locales optimizados para modelos MoE y arquitecturas de agentes soberanas con retorno de inversión garantizado.


7. Preguntas Frecuentes

¿Qué significa la nomenclatura "35B-A3B"?

Significa que el modelo cuenta con 35.000 millones de parámetros totales almacenados en memoria, pero para procesar cada palabra o token solo activa un subconjunto de expertos equivalente a 3.000 millones de parámetros activos (A3B).

¿Por qué es más rápido un modelo MoE que un modelo denso equivalente?

Porque un modelo denso de 27B o 32B obliga a la tarjeta gráfica a calcular todas las capas para cada token, mientras que el modelo MoE solo ejecuta los cálculos de 3B parámetros, requiriendo una fracción de los FLOPS y logrando el triple de velocidad.

¿Cuándo estarán disponibles los pesos descargables de Qwen 3.8-35B-A3B?

Históricamente, cuando Alibaba añade las definiciones de modelos en los repositorios de ModelScope (ms-swift), la publicación de pesos en Hugging Face suele producirse en un plazo de pocos días o semanas.

initiating_deployment...

Pasa de la teoría a la ejecución

El conocimiento sin implementación técnica es solo entretenimiento. Agenda tu consultoría de 60 minutos: te devolvemos el 100% del importe si en los primeros 15 minutos vemos que la IA no es viable para tu caso, y si decides contratar el proyecto con nosotros, te descontamos el coste total de la sesión del presupuesto final.

Reservar Consultoría