Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями +7 11.09.2026 14:58 damir9311 7 Искусственный интеллект Машинное обучение Операционные системы Серверное администрирование
Контекст растёт, KV-кэш — нет: Qwen3.8-27B на ограниченной VRAM с CMF формате +3 09.09.2026 09:34 infosave 1 Rust Искусственный интеллект Серверная оптимизация
Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле +8 04.08.2026 09:34 0xReality 16 Искусственный интеллект Компьютерное железо Машинное обучение Облачные сервисы Финансы в IT
vLLM Production Stack. Часть 1: Базовые возможности vLLM +2 27.03.2026 16:09 Bambarambambum 0 DevOps Системное администрирование Видеокарты Kubernetes