
La guerra por la inferencia móvil no se gana con modelos más grandes, sino con menos I/O y una cadena de valor mejor repartida
PowerInfer-2 promete hasta 29,2x aceleración y 11,68 tokens/s en un Mixtral-47B en смартфones al convertir la escasez —memoria e I/O— en un diseño operativo. La pregunta estratégica no es solo técnica: es quién captura el valor cuando el costo por token se desploma en el borde.
Martín Soler6 min






































