Experimentos · 6 min
Inferencia local en una Mac: DeepSeek y Qwen frente a frente
Una comparación reproducible de dos modelos locales cuantizados en una Apple M1 Pro con 16 GB de memoria unificada.
Esta es una medición concreta del trabajo de Zyrabit: la misma pregunta, dos modelos locales y una Apple M1 Pro con 16 GB de memoria unificada.
La pregunta fue: «¿Cuáles son los tres colores primarios?»
La comparación es útil porque las respuestas no son idénticas. DeepSeek devolvió la interpretación RGB/física —rojo, azul y verde— mientras que Qwen devolvió la interpretación RYB/pigmento —rojo, azul y amarillo—. La diferencia recuerda que un benchmark también mide interpretación, no solamente velocidad.
Modelos
DeepSeek-R1-Distill-Llama-8B
- Archivo:
DeepSeek-R1-Distill-Llama-8B-Q4_K_M.gguf - Tamaño:
4.92 GB - Velocidad promedio: aproximadamente
20 tokens/s - Respuesta de extremo a extremo:
3.96 segundos / 3962 ms
Qwen2.5 7B Instruct
- Archivo:
qwen2.5-7b-instruct.gguf - Tamaño:
4.40 GB - SHA256:
2bada8a7450677000f678be90653b85d364de7db25eb5ea54136ada5f3933730 - Velocidad promedio: aproximadamente
40 tokens/s - Respuesta de extremo a extremo:
2.17 segundos / 2172 ms
El SHA256 fue validado durante el arranque. La comparación usa los archivos de modelo cargados por el runtime local, no alias basados en symlinks.
Comparación de respuesta
| Métrica | DeepSeek-R1-Distill-Llama-8B | Qwen2.5 7B Instruct |
|---|---|---|
| Respuesta de extremo a extremo | 3.96 s | 2.17 s |
| Velocidad promedio | ~20 tokens/s | ~40 tokens/s |
| Archivo del modelo | 4.92 GB | 4.40 GB |
| Respuesta | Rojo, azul y verde — RGB/física | Rojo, azul y amarillo — RYB/pigmento |
Qwen fue casi el doble de rápido en esta prueba. La explicación práctica observada aquí es que va directamente a la respuesta final en lugar de transmitir tokens internos de razonamiento como <think> antes de la respuesta visible.
Memoria y Apple Silicon
Apple Silicon usa memoria unificada, compartida entre CPU y GPU. Por eso este reporte utiliza memoria unificada y asignación Metal, en lugar de tratarla como VRAM discreta.
| Métrica de memoria | DeepSeek-R1-Distill-Llama-8B | Qwen2.5 7B Instruct |
|---|---|---|
| RSS del proceso | ~25 MB | ~2.81 GB / 2,814,464 KB |
| Asignación Metal | ~4.92 GB | ~4.40 GB |
| Memoria libre después de cargar | ~14.49 GB | ~9.73 GB |
El valor RSS y la asignación Metal son mediciones distintas. No deben sumarse como si fueran el mismo pool ni generalizarse a todos los runtimes o formatos de cuantización.
Condiciones y límites
Los resultados corresponden a esta Apple M1 Pro, 16 GB de memoria unificada, los builds registrados, aceleración local con Metal, la misma pregunta y el mismo setup de runtime. No son un ranking universal de los modelos. Un prompt más largo, un arranque en frío, otra longitud de contexto, una versión diferente del runtime o una cuantización distinta pueden cambiar el resultado.
El siguiente paso útil es registrar esas variables junto a cada medición: sistema operativo, versión del runtime, hash del modelo, longitud del prompt, tokens generados, estado del arranque, uso de Metal y memoria antes y después de cargar.
Por qué importa para Zyrabit
El punto no es afirmar que cualquier modelo local sea suficientemente rápido para cualquier tarea. El punto es hacer visible el límite en hardware accesible: qué puede ejecutarse localmente, qué intercambios debe comunicar la interfaz y dónde debe permanecer la persona en control.