NVIDIA, Microsoft и партнёры представили на IFA 2026 решения для ускорения локального ИИ, включая новые инструменты для агентов и ПК RTX Spark от Lenovo и Acer, выход которых запланирован на октябрь. Оптимизации llama.cpp и vLLM обеспечивают до 1.9x ускорения локального инференса, доступные напрямую и через LM Studio и Ollama.
Среди новостей: упрощённая поддержка локальных моделей в Hermes Agent, OpenClaw и Perplexity Portable Computer; инструмент NVIDIA PAIR для распределения инференса по локальной сети; выход моделей Nemotron 3.5 Lightning, Qwen3.8-Flash-Next, Qwen3.8-27B, LTX 2.5, MiniMax-H3, FastH3, Muse Glimmer и DeepSeek v4 Flash, оптимизированных для NVIDIA RTX, DGX Spark и DGX Station.