
Origen y pruebas del rendimiento anunciado
Inco AI publicó en X que su motor Splash alcanzó 144 tokens por segundo con el modelo Qwen3.8-27B corriendo en un MacBook Pro con chip M5 Max. Este es un dato comunicado directamente por Inco AI sin confirmación oficial de Alibaba, creadora del modelo.
Además, LM Studio replicó esa cifra y compartió instrucciones para instalar el motor Splash y los requisitos de sistema: macOS 26.4, un Mac con chip M3 o superior y al menos 36 GB de RAM.
Este respaldo aporta credibilidad al dato aunque no sea una prueba independiente ni oficial. Los anuncios se difunden principalmente en comunidades de IA en Reddit y en Twitter.
No hay indicios de mediciones realizadas fuera de estas fuentes ni documentación oficial que avale el desempeño, por lo que el dato debe tomarse con cautela.
Características técnicas del hardware y software implicados
El hardware usado para medir la velocidad es un MacBook Pro equipado con el chip M5 Max, parte de la última generación de procesadores Apple Silicon diseñado para tareas exigentes.
Entre los requisitos de software explican que se emplea macOS 26.4, una versión avanzada del sistema operativo adaptada para optimizar cargas de trabajo de IA con soporte para instrucciones específicas del hardware.
Para lanzar el modelo, Inco AI detalla comandos específicos como 'splash serve --model incoai/Qwen3.8-27B-Splash' y recomienda instalar Splash desde el repositorio empaquetado con Homebrew.
Esto demuestra que la ejecución pretende ser accesible para usuarios con conocimiento medio o avanzado de IA y sistemas Apple, con herramientas optimizadas para ese entorno.
Implicaciones para usuarios y desarrolladores en ecosistema Apple
Con la confirmación de velocidades de 144 tokens por segundo en dispositivos Apple propios, se abre una vía para ejecutar modelos grandes y complejos sin depender del cloud, manteniendo privacidad y control local.
Esto puede ser atractivo para profesionales, investigadores o entusiastas que usan Mac y buscan ejecutar modelos como Qwen3.8-27B eficientemente sin hardware externo.
Los desarrolladores disponen de una nueva hoja de ruta al combinar motores optimizados como Splash con modelos de peso moderado como este, que balancean tamaño y rendimiento.
Sin embargo, la falta de verificación ajena invita a precaución antes de considerar esta implementación como estándar o referencia definitiva.
Qué queda por confirmar y próximos pasos para validar
Aunque LM Studio replicó la cifra anunciada por Inco AI, no existe una evaluación independiente en laboratorios externos o benchmarks oficiales para corroborar la cifra de 144 tokens por segundo.
También falta documentación oficial de Alibaba para confirmar que Qwen3.8-27B funciona así en configuraciones reales Apple y no solo en pruebas limitadas.
Verificar la estabilidad del rendimiento en escenarios de producción, la calidad de las inferencias y cómo escala con otros chips Apple serán pasos clave que la comunidad debe seguir.
La llegada de análisis independientes y pruebas en otras máquinas ayudará a medir la generalización y reproducibilidad de este dato.