Liquid AI LFM2.5-8B-A1B: Análisis de un modelo MoE eficiente para dispositivos locales
El nuevo modelo MoE de Liquid AI equilibra 8.3B de parámetros totales con 1.5B activos para optimizar la velocidad de inferencia local y el razonamiento.
277 noticias en el archivo
El nuevo modelo MoE de Liquid AI equilibra 8.3B de parámetros totales con 1.5B activos para optimizar la velocidad de inferencia local y el razonamiento.
Un análisis de la actualización de Claude Opus 4.8, que sostiene que los pequeños refinamientos en la controlabilidad y el precio no sustituyen a las ganancias reales de inteligencia.
Google lanza una placa compacta para la ejecución local de Gemma 3, pero se enfrenta a desafíos con la accesibilidad del SDK y la competencia de las GPUs existentes.
Soro aprovecha Gemma 3 para ofrecer un LLM local y culturalmente matizado, especializado en tayiko, priorizando la eficiencia y la inferencia local frente a los modelos generalistas.
Un análisis de los costes de latencia y VRAM al utilizar el reranker Zerank-2 de 4B parámetros en pipelines RAG de producción.
Stability AI publica los pesos abiertos de las variantes Small y Medium de Stable Audio 3, permitiendo la generación de audio de alta calidad en GPUs de consumo.
EAGLE 3.1 aborda la deriva de atención para ofrecer un throughput más consistente y predecible en la inferencia de LLMs mediante decoding especulativo.
El sistema OSCAR de Together AI utiliza rotaciones conscientes de la atención para comprimir los KV cache a 2 bits, ampliando significativamente las ventanas de contexto en GPUs de consumo.
Deja de depender de la intuición y empieza a utilizar pipelines de observabilidad como Langfuse para aportar rigor de ingeniería a la gestión y evaluación de prompts de LLMs locales.
Un estudio de ByteDance sugiere que entrenar modelos multimodales mediante preguntas y respuestas supera a los métodos basados en transcripción para analizar documentos largos y complejos.