Mientras la comunidad de desarrolladores celebraba la llegada del modelo denso Qwen 3.8-27B en Hugging Face y sus recientes versiones cuantizadas en GGUF por Unsloth, una actualización silenciosa en el repositorio oficial de ModelScope ms-swift ha desvelado el verdadero salto estratégico de Alibaba: el registro del modelo Qwen/Qwen3.8-35B-A3B.
El hallazgo, detectado en el commit ab726e9d445a6520a70df2c831177d46adb1f589, confirma que el equipo de Qwen prepara la liberación de un modelo basado en Mezcla de Expertos (MoE - Mixture of Experts) con 35.000 millones de parámetros totales donde solo se activan ~3.000 millones de parámetros por cada token generado (A3B = Active 3 Billion).
Para el tejido empresarial y las PYMEs que buscan soberanía tecnológica sin invertir en servidores de miles de euros, este modelo representa una ventaja operativa superior frente a los modelos densos tradicionales.
En este artículo analizamos la prueba técnica del commit filtrado, la física del cálculo MoE frente a modelos densos, los requisitos de hardware en VRAM/RAM y por qué este modelo democratiza los agentes de producción locales.
1. La evidencia técnica: El commit de ModelScope
La filtración no procede de un rumor anónimo, sino del repositorio oficial de herramientas de fine-tuning y despliegue de Alibaba (modelscope/ms-swift), donde se han añadido las definiciones de plantillas y cargadores específicos para la arquitectura MoE de Qwen 3.8:

Como se observa en el código fuente de swift/model/models/qwen.py:
- Se incorpora el identificador oficial
Qwen/Qwen3.8-35B-A3By su variante nativa enFP8. - Se utiliza el cargador
Qwen3_5MoeLoadercon la plantillaTemplateType.qwen3_8. - Se añade también el modelo insignia de alta escala
Qwen/Qwen3.8-2.4T-A95B(2.4 trillones con 95B activos).
2. Denso vs. MoE: ¿Por qué 35B-A3B es revolucionario para PYMEs?
Para entender el impacto financiero y de rendimiento de este modelo, es necesario comprender la diferencia matemática entre un modelo denso y una arquitectura Mixture of Experts (MoE):
┌─────────────────────────────────────────────────────────────────────────┐
│ COMPARATIVA DE ARQUITECTURA COMPUTACIONAL │
├───────────────────────────────────┬─────────────────────────────────────┤
│ MODELO DENSO (QWEN 3.8-27B) │ MODELO MOE (QWEN 3.8-35B-A3B) │
├───────────────────────────────────┼─────────────────────────────────────┤
│ • 27.000M parámetros calculados │ • 35.000M parámetros totales en VRAM│
│ por CADA token generado │ • Solo ~3.000M parámetros activos │
│ • Alto consumo de FLOPS por token │ por cada token generado │
│ • Velocidad moderada (20-30 t/s) │ • Coste computacional de modelo 3B │
│ • Exige GPUs con gran ancho de bus│ • Velocidad ultra-rápida (60-90 t/s)│
└───────────────────────────────────┴─────────────────────────────────────┘
La ventaja del enrutamiento de expertos:
- Capacidad de conocimiento de 35B: El modelo tiene 35 billones de parámetros distribuidos en diferentes redes neuronales expertas (código, razonamiento matemático, extracción de datos, redacción legal).
- Velocidad de ejecución de un 3B: Un router dinámico selecciona únicamente los 2 o 3 expertos relevantes para responder a la consulta. Al generar cada token, tu tarjeta gráfica solo realiza las operaciones matemáticas equivalentes a un modelo diminuto de 3B.
- Throughput masivo en GPUs modestas: Mientras que un modelo denso de 27B satura los núcleos CUDA de una NVIDIA RTX 3060/4060 o RTX 4070 (8GB - 12GB - 16GB), el modelo 35B-A3B cuantizado en 4 bits genera texto a velocidades superiores a 60-80 tokens por segundo.
3. Matriz de Hardware y Requisitos para Empresas
Gracias a que la carga de cómputo por token es de solo 3B, el factor limitante ya no es la potencia del procesador gráfico, sino únicamente disponer de memoria suficiente para alojar los pesos del modelo:
| Formato / Cuantización | Memoria Total (VRAM + RAM) | Velocidad Estimada | Hardware Mínimo Recomendado |
|---|---|---|---|
| Q3_K_M (MoE) | ~14 GB | 70-90 tok/s | GPU 12GB (RTX 3060/4070) o PC 24GB RAM |
| Q4_K_M (Estándar) | ~18-20 GB | 60-80 tok/s | 1x RTX 4080 (16GB) / RTX 4090 / Mac 32GB |
| Q5_K_M / Q6_K | ~23-26 GB | 50-70 tok/s | Mac Studio 36GB / 2x GPUs 16GB / 48GB RAM |
| FP8 Nativo | ~35 GB | 80-110 tok/s | 2x RTX 4090 (48GB VRAM) / Mac Studio 64GB |
4. Casos de uso de alto rendimiento para PYMEs con Qwen 3.8-35B-A3B
┌──────────────────────────────────────────────────────────────┐
│ ARQUITECTURA DE AGENTES CON QWEN 3.8-35B-A3B │
└──────────────────────────────┬───────────────────────────────┘
│
┌───────────────┴───────────────┐
▼ ▼
[Alto Rendimiento Local] [Cero Coste por Token]
│ │
┌───────┴───────┐ ┌───────┴───────┐
▼ ▼ ▼ ▼
[Atención Clientes] [Extracción ERP] [Agentes Código] [Normativa Fiscal]
(Latencia <100ms) (Bases SQL) (DeepSeek-Harn) (VeriFactu RGPD)
- Atención al Cliente y Call Centers con Latencia Cero: La velocidad de más de 70 tokens/segundo permite integrar el modelo con sistemas de voz interactiva en tiempo real (Voice AI) sin pausas molestas para el usuario.
- Procesamiento Masivo de Facturación (VeriFactu): Extrae y valida NIFs, bases imponibles y líneas de pedido en cientos de facturas por minuto sin pagar un solo céntimo en APIs comerciales.
- Agentes Autónomos con DeepSeek Harness y Executor.sh: Al ejecutar bucles de llamadas a herramientas (tool calling loops), la alta velocidad de generación evita cuellos de botella en la ejecución de scripts en terminal.
5. Estrategia Híbrida: Cómo preparar tu infraestructura
Ante la inminente liberación de los pesos oficiales por parte de Alibaba, las empresas deben estructurar su pila tecnológica:
- Paso 1 (Preparación de Pasarelas MCP): Configurar servidores de datos locales mediante protocolos estandarizados para que el modelo se conecte directamente al CRM o ERP interno.
- Paso 2 (Segregación de Cargas): Mantener APIs como Gemini 3.7 Flash o GLM-5.3 para ingesta masiva de vídeo y PDFs de 1 millón de tokens, y delegar el 100% de las tareas recurrentes y confidenciales a Qwen 3.8-35B-A3B en local.
6. Siguientes pasos para tu empresa
La arquitectura Mixture of Experts (MoE) marca el fin de la dependencia forzosa de la nube para tareas de alta velocidad y volumen.
Reserva una Consultoría de Despliegue de IA Local con IA4PYMES → Diseñamos e instalamos servidores locales optimizados para modelos MoE y arquitecturas de agentes soberanas con retorno de inversión garantizado.
7. Preguntas Frecuentes
¿Qué significa la nomenclatura "35B-A3B"?
Significa que el modelo cuenta con 35.000 millones de parámetros totales almacenados en memoria, pero para procesar cada palabra o token solo activa un subconjunto de expertos equivalente a 3.000 millones de parámetros activos (A3B).
¿Por qué es más rápido un modelo MoE que un modelo denso equivalente?
Porque un modelo denso de 27B o 32B obliga a la tarjeta gráfica a calcular todas las capas para cada token, mientras que el modelo MoE solo ejecuta los cálculos de 3B parámetros, requiriendo una fracción de los FLOPS y logrando el triple de velocidad.
¿Cuándo estarán disponibles los pesos descargables de Qwen 3.8-35B-A3B?
Históricamente, cuando Alibaba añade las definiciones de modelos en los repositorios de ModelScope (ms-swift), la publicación de pesos en Hugging Face suele producirse en un plazo de pocos días o semanas.
