Главная / Статьи / Бюджетный AI-сервер

Кейс системного администратора

Бюджетный AI-сервер своими руками: сборка под локальные нейросети на RTX 3090

Локальный AI-сервер нужен, когда важно запускать нейросети рядом с данными, не отправлять рабочие документы в сторонние облака и иметь полный контроль над железом, доступом и настройками. Ниже — не универсальная инструкция, а пример реальной инженерной сборки: подбор комплектующих, размещение нескольких видеокарт, питание, охлаждение, тесты и выводы по стоимости.

Открытый стенд AI-сервера с видеокартами NVIDIA GeForce RTX 3090
Первый вариант стенда с несколькими видеокартами показал главный риск: мощные GPU можно запустить на столе, но для постоянной работы нужен нормальный корпус, питание и охлаждение.

Что я называю бюджетным AI-сервером

В этой задаче под бюджетным AI-сервером я понимаю не игрушечный компьютер «для попробовать», а рабочую машину под локальные LLM-модели: сервер для нейросетей, где основная ставка делается на видеопамять, б/у комплектующие и аккуратную инженерную сборку. Такой подход особенно интересен тем, кто ищет: сборку AI-сервера, сервер для локальной нейросети, LLM-сервер на RTX 3090, локальный ChatGPT-аналог для офиса или приватный сервер искусственного интеллекта.

Главная идея простая: не покупать дорогую серверную платформу с самого начала, а собрать практичную конфигурацию из доступных комплектующих. Но «бюджетный» не означает «как попало». В AI-сервере критичны совместимость PCIe, питание видеокарт, тепловой режим, скорость загрузки моделей, стабильность драйверов NVIDIA и понимание, где узкое место — процессор, диск, чипсет, шина PCIe или сама модель.

Задача: спрятать несколько GPU в нормальный корпус

Первый открытый стенд с несколькими видеокартами позволял запускать большие модели, но для постоянной эксплуатации он был неудобен. Три крупные видеокарты уровня RTX 3090 плохо помещаются в обычный десктопный корпус, а типовые материнские платы часто не дают удобного расстояния между PCIe-слотами. Поэтому я рассматривал майнинговые решения: у них больше слотов, больше места между картами и проще организовать направленный обдув.

На практике выяснилось, что майнинговая плата — это не автоматическое решение всех проблем. У таких плат могут быть ограничения по линиям PCIe, питанию, посадочным местам, сетевому интерфейсу и совместимости с отдельными видеокартами. Именно поэтому перед сборкой AI-сервера важно не просто «купить плату на много видеокарт», а заранее понимать, какие модели GPU будут установлены и как они будут использоваться.

Горизонтальный корпус для AI-сервера и майнинговая материнская плата
Майнинговый корпус удобен для нескольких видеокарт: есть место под GPU, направленный обдув и отдельная зона под блок питания. Но крепления и расстояние между слотами нужно проверять заранее.

Почему я ушёл от простой ETH B75 к ASRock H510 Pro BTC+

Первый вариант был очень дешёвым: горизонтальный корпус, старая плата ETH B75, процессор Intel Celeron и шумный майнинговый блок питания. Для эксперимента этого хватило, но для AI-сервера быстро проявились ограничения: слабая платформа, медленная сеть, старая память и PCIe-слоты с одной линией на каждую видеокарту.

Самый неприятный момент — не каждая видеокарта корректно работает в таком режиме. В моём случае Tesla P40 определялась системой, но драйвер NVIDIA не видел её как рабочую карту для вычислений. Для сборки под нейросети это критично: карта может физически стоять в слоте и даже отображаться на уровне шины, но не участвовать в инференсе.

После этого я перешёл на ASRock H510 Pro BTC+. Эта плата интереснее для бюджетного AI-сервера: сокет LGA1200, поддержка более современных процессоров Intel Core 10/11 поколения, DDR4, гигабитная сеть и полноценный первый PCIe-слот. Для моей задачи это было важнее, чем просто большое количество разъёмов.

ASRock H510 Pro BTC+ для сборки AI-сервера на нескольких видеокартах
Для AI-сервера важны не только количество PCIe-слотов, но и то, какие линии куда идут: часть устройств может упираться в чипсет и общую пропускную способность.

Питание и охлаждение: место, где нельзя экономить вслепую

Видеокарты уровня RTX 3090 потребляют много энергии и чувствительны к качеству питания. В тестовой конфигурации при недостатке отдельных PCIe-кабелей приходилось снижать энергопотребление, иначе карты могли отваливаться под нагрузкой. Для клиента я бы не оставлял такую сборку «на честном слове»: нужно считать потребление, проверять разъёмы, распределять нагрузку по кабелям, выставлять power limit и прогонять стресс-тесты.

Охлаждение не менее важно. Майнинговый корпус даёт сильный поток воздуха, но его нужно правильно направить через радиаторы видеокарт. У домашней или офисной сборки есть ещё один фактор — шум. Блок питания и вентиляторы, которые нормально подходят для гаражной майнинг-фермы, могут оказаться неприемлемыми для квартиры или рабочего кабинета.

Прокладка питания и кабелей в AI-сервере с несколькими RTX 3090
В подобных сборках важна не только производительность видеокарт, но и аккуратное питание: отдельные линии, отсутствие перегруза кабелей, контроль температуры и стабильность под длительной нагрузкой.

Тесты на локальной LLM: что показала сборка

На этой конфигурации я запускал GPT-OSS 120B через локальный сервер на базе llama.cpp. Промежуточный вариант с RTX 3090, RTX 3090 Ti и Tesla P40 давал около 65 токенов в секунду, но слабая карта становилась ограничителем. После перехода к трём картам RTX 3090 и настройки энергопотребления удалось выйти примерно на 100 токенов в секунду.

Дальше я проверил влияние процессора и памяти. Замена двухъядерного Celeron на Intel Core i5-10600KF и установка более быстрой DDR4-памяти дали прирост примерно до 110 токенов в секунду. Это полезный результат, но он показывает важную вещь: в AI-сервере не всегда самый заметный апгрейд даёт самый большой прирост. Иногда главное ограничение находится не в процессоре, а в видеопамяти, PCIe, загрузке модели или выбранной квантизации.

Тест локальной LLM-модели на AI-сервере с RTX 3090
Финальный тест показал около 110 токенов в секунду. Это не обещание для любой сборки, а результат конкретной конфигурации, модели, квантизации и настроек.

Оптимизация загрузки модели: почему диск тоже важен

Отдельная проблема — скорость загрузки большой модели на видеокарты. Сначала модель загружалась примерно за 3,5 минуты. После переноса данных на NVMe и подключения через PCIe-адаптер в первый слот, линии которого идут напрямую к процессору, время загрузки удалось сократить примерно до 2 минут.

Это хороший пример того, почему сборка AI-сервера — не просто «поставить много видеокарт». Нужно понимать архитектуру платформы: что идёт через процессор, что через чипсет, где DMI становится бутылочным горлышком, а где быстрый NVMe не даст ожидаемого выигрыша.

Оптимизация загрузки модели на AI-сервере через NVMe и PCIe
Перенос модели на NVMe, подключённый через CPU-линии PCIe, позволил уменьшить время загрузки с 3 минут 30 секунд примерно до 2 минут.

Ориентировочная стоимость такой сборки

Цены на б/у комплектующие сильно меняются, особенно на видеокарты после майнинга. Поэтому для нормального расчёта я делю смету на две части: стоимость железа и стоимость инженерной работы. Ниже — ориентир для бюджетной сборки на трёх RTX 3090, без претензии на фиксированный прайс.

Компонент Ориентир, ₽ Комментарий
Корпус под несколько видеокарт 8 000–14 000 Б/у можно найти дешевле, новый майнинговый корпус обычно дороже.
Материнская плата под 4–6 GPU 8 000–25 000 ASRock H510 Pro BTC+ и аналоги. Важно проверять состояние и совместимость.
CPU уровня Intel Core i5-10600KF 7 000–13 000 Для инференса CPU не всегда главный ускоритель, но слабый процессор может мешать общей отзывчивости.
ОЗУ DDR4 16–32 ГБ 4 000–12 000 Минимум для такой платформы — 16 ГБ, комфортнее закладывать 32 ГБ.
SSD/NVMe под систему и модели 5 000–10 000 Для больших моделей лучше не экономить на накопителе и способе подключения.
Блок питания 1200 Вт и выше 10 000–18 000 Нужны нормальные линии питания GPU, запас по мощности и проверка под нагрузкой.
RTX 3090 24 ГБ, 3 шт. 180 000–300 000 Самая дорогая часть сборки. Для бюджета обычно смотрят б/у карты, но их надо тщательно тестировать.
Кабели, райзеры/адаптеры, кулер, мелочёвка 5 000–15 000 На мелочах часто всплывают задержки: переходники, питание, крепёж, охлаждение.
Итого по железу примерно 227 000–407 000 Реальная сумма зависит от состояния видеокарт, удачной покупки б/у комплектующих и требований к шуму.

Сколько стоит услуга по сборке AI-сервера

Если клиенту нужен похожий проект под ключ, стоимость моей работы я бы считал отдельно от комплектующих. Это не обычная сборка игрового ПК: здесь нужны подбор железа под модель, проверка видеокарт, сборка, Linux, драйверы NVIDIA, CUDA-окружение, настройка llama.cpp/Ollama/Open WebUI, тестирование, ограничение потребления, базовая безопасность и понятная памятка для владельца.

Формат работы Цена за работу Что входит
Консультация и подбор конфигурации от 5 000 ₽ Разбор задачи, модели, бюджета, требований к приватности, шуму и месту установки.
Сборка и базовая проверка железа от 25 000 ₽ Монтаж, питание, охлаждение, первичный запуск, проверка видеокарт и стабильности.
AI-сервер под ключ от 45 000 ₽ Сборка, Linux, драйверы, запуск локальной LLM, веб-интерфейс, тесты, памятка по эксплуатации.
Сложный проект для офиса или команды от 80 000 ₽ Удалённый доступ, пользователи, ограничения, мониторинг, резервное копирование, документация и сопровождение.

Точную стоимость правильно считать после короткого ТЗ: какие модели нужно запускать, сколько пользователей, нужен ли веб-интерфейс, будет ли сервер стоять дома или в офисе, важна ли тишина, кто покупает комплектующие и нужна ли дальнейшая поддержка.

Что я могу сделать для клиента

Я могу не просто «собрать компьютер», а довести проект до рабочего состояния: подобрать конфигурацию под локальные нейросети, проверить совместимость железа, собрать AI-сервер, настроить Linux, NVIDIA-драйверы, CUDA-окружение, Docker, llama.cpp, Ollama или Open WebUI, сделать базовые тесты скорости, ограничить энергопотребление и оставить понятную схему эксплуатации.

Отдельно могу помочь с удалённым доступом, безопасной публикацией веб-интерфейса внутри локальной сети или через VPN, мониторингом температуры и нагрузки, резервным копированием конфигурации и документированием решения. Для бизнеса это особенно важно: сервер должен быть не экспериментом на столе, а понятной системой, которую можно включить, обслуживать и безопасно использовать.

Кому подходит локальный AI-сервер, а кому лучше облако

Локальный AI-сервер имеет смысл, если приватность и контроль важнее минимальной цены запроса. Например, когда нужно работать с внутренними документами, кодом, базами знаний, техническими инструкциями или клиентскими материалами без передачи их в сторонний сервис.

Но честно: облачный инференс часто дешевле и проще на старте. Если задача разовая, нет чувствительных данных и не нужно постоянно гонять модели локально, облако может оказаться разумнее. Локальный сервер выигрывает там, где важны автономность, контроль, приватность, предсказуемая инфраструктура и возможность настроить всё под себя.

Нужен бюджетный AI-сервер своими руками?

Если вы хотите собрать локальный сервер для нейросетей на RTX 3090, проверить б/у видеокарты, запустить LLM-модель у себя дома или в офисе и получить рабочий веб-интерфейс без лишней магии — можно обсудить задачу и подобрать реалистичную конфигурацию под ваш бюджет.

Услуга: Бюджетный AI-сервер своими руками — подбор, сборка и настройка локального сервера искусственного интеллекта.

Ориентир по работе: от 45 000 ₽, без стоимости комплектующих.

Частые вопросы

Можно ли собрать AI-сервер дешевле?

Можно, если брать одну видеокарту, более простую модель и б/у комплектующие. Но для больших LLM основное ограничение — видеопамять, поэтому слишком сильная экономия быстро упирается в невозможность загрузить нужную модель.

Почему RTX 3090 часто используют для локальных нейросетей?

У RTX 3090 есть 24 ГБ видеопамяти, и на вторичном рынке эта карта часто выглядит разумным компромиссом между ценой, объёмом VRAM и производительностью для локального инференса.

Можно ли поставить такой сервер дома?

Да, но нужно учитывать шум, тепло, потребление электроэнергии, качество блока питания и место установки. Для дома особенно важно не использовать слишком шумные майнинговые блоки питания и вентиляторы без регулировки.

Можно ли сделать веб-интерфейс как у ChatGPT?

Да, локальную модель можно подключить к веб-интерфейсу, например через Open WebUI или другой подходящий интерфейс. Конкретное решение зависит от модели, железа и требований к доступу.