IA Local
4 min
Impacto del Offloading en la Inferencia Local: Análisis de Flash Attention y KV Cache
Evaluamos las técnicas de optimización de memoria de Ollama en una RTX 5080. Analizamos cómo el bus PCIe condiciona la …
5 jun 2026
Evaluamos las técnicas de optimización de memoria de Ollama en una RTX 5080. Analizamos cómo el bus PCIe condiciona la …
Cuando un modelo no cabe en VRAM, la velocidad cae 20x. No es gradual, es un cliff. Medí la degradación por contexto (4K …
Tabla de decisión por GPU: RTX 5060 (8GB), 5070 (12GB), 5080 (16GB), 5090 (32GB). Qué modelo Ollama instalar, cuánta …