Imagina a un desarrollador a las 3 de la mañana, mirando un dashboard de Stripe y preguntándose por qué sus costos de API escalan más rápido que su base de usuarios. Ha pasado las últimas seis horas intentando optimizar un prompt que aún tarda tres segundos en devolver una respuesta, matando efectivamente la experiencia del usuario. Es el clásico impuesto de la nube: intercambias tus márgenes y tu latencia por la comodidad de no tener que preocuparte por la VRAM (que es donde usualmente se oculta el costo real). El sueño es una experiencia local y rápida, pero la realidad suele ser un prompt que se queda colgado justo el tiempo suficiente para hacer que el usuario se pregunte si la aplicación se ha congelado.
Esta es la fricción en la que apuesta MacPaw. Han anunciado una asociación con Liquid AI para llevar la inferencia en dispositivo a su ecosistema, específicamente para su asistente de IA Eney y los desarrolladores que construyen para su app store. El objetivo es trasladar el cómputo del servidor al silicio que está en el escritorio del usuario, evitando el viaje de ida y vuelta a un data center. Según TechCrunch, esto no se trata solo de una sola aplicación, sino de crear un pipeline para que otros desarrolladores implementen IA local sin la típica pesadilla de infraestructura de gestionar sus propios pesos y esquemas de cuantización.
He aquí el análisis: la IA en dispositivo es la obsesión actual, pero la mayor parte de la IA “local” es solo una versión cuantizada de un modelo gigante que hace que tu portátil suene como un motor de jet despegando. Liquid AI afirma que su enfoque—Liquid Neural Networks—es más eficiente porque maneja datos de series temporales y se adapta con más fluidez que un Transformer estándar. Es como la diferencia entre un conjunto rígido de instrucciones y un músico de jazz que puede pivotar según el ritmo de la habitación. Esto me recuerda a la oleada de marketing de “AI PC” que vimos el año pasado, donde cada fabricante de portátiles afirmaba que su máquina era una potencia neural, solo para que los usuarios descubrieran que “listo para IA” significaba mayormente “tiene una NPU que aún no puedes usar de verdad.” ¿Podemos confiar realmente en que una arquitectura diferente resuelva la física del ancho de banda de memoria?
Pero seamos honestos con la parte de la “app store”. MacPaw no solo está siendo generosa con sus herramientas; está intentando construir un foso defensivo. Si logran convencer a una masa crítica de desarrolladores de construir específicamente para su stack de inferencia local, habrán creado un lock-in más difícil de romper que una simple API key. ¿Quién quiere realmente gestionar sus propios pesos locales en una app store de terceros? Probablemente solo las personas aterrorizadas de que sus datos se filtren en un conjunto de entrenamiento o las que están cansadas de pagar suscripciones mensuales por funciones que deberían ser locales. Es una jugada para el “desarrollador soberano” que quiere ofrecer privacidad como una característica sin pasar seis meses escribiendo kernels en C++.
El verdadero problema sigue siendo el hardware. Puedes tener la arquitectura más eficiente del mundo, pero si el usuario tiene un MacBook Air de modelo base con 8GB de memoria unificada, sigues librando una batalla perdida. Intentar ejecutar un LLM razonablemente capaz en hardware de gama baja es como intentar meter un piano de cola en un estudio de un dormitorio: técnicamente podría caber, pero no puedes moverte por la habitación. Si los modelos de Liquid AI no pueden reducir drásticamente el piso de memoria, esta asociación es solo un wrapper elegante para un grupo nicho de usuarios avanzados que ya compraron los chips Max.
El cuello de botella del hardware no le importa tu arquitectura.
Es una jugada estratégica inteligente, pero la ejecución lo es todo. Si la experiencia del desarrollador es torpe o la latencia sigue siendo notable, esto será solo otra nota al pie en la historia de las utilidades “impulsadas por IA”. Para el Q1 de 2027, veremos si esta asociación conduce a un aumento medible en aplicaciones de IA local-first o si la industria continúa por defecto en el modelo de “thin client” porque simplemente es más fácil mantener un solo servidor que un millón de dispositivos edge fragmentados.