RUEN
К статьям
Бесплатно Миграция

Сдать видеокарту в аренду на Vast.ai: чек-лист перед запуском

Редакция Vast Sale, 8 мин

Быстрый чек-лист, который стоит пройти до переноса. Он экономит время и снижает риск простоя в первые дни на Vast.ai. Мы держим шесть своих машин с десятью картами и обслуживаем клиентские, и почти каждый пункт ниже попал сюда не из документации площадки, а после того, как мы на нём споткнулись. Порядок тоже важен: первые три пункта проверяются до создания аккаунта хоста, последние два — в день переключения. Цифры по каждой нашей машине открыты на странице «Парк» сайта vast.sale: витрину нашего парка

Короткая версия — пять пунктов. На каждый дальше есть раздел с конкретными порогами, командами и нашими замерами.

  • Актуальные драйверы NVIDIA и версия CUDA — и зафиксированные, чтобы ночной апдейт их не унёс
  • Стабильный интернет-канал и открытые порты — по замеру, а не по тарифу из договора
  • Достаточное охлаждение и питание — отдельная линия 16 А, ИБП и авто-старт после сбоя
  • Резервный доступ к серверу — второй путь внутрь, проверенный до того, как он понадобился
  • Учтён переходный период с Clore — переключаться не в один день
Официальный минимум Vast.ai по железу, сети и ОС — с этим сверяются все пункты ниже
Официальный минимум Vast.ai по железу, сети и ОС — с этим сверяются все пункты ниже

1. Драйверы и CUDA: важнее версии — фиксация

Система у нас всегда Ubuntu 22.04 Server с ядром HWE 6.8: более новые релизы для хоста мы считаем сырыми. Драйвер должен видеться в nvidia-smi, все карты — в nvidia-smi -L, и счёт должен совпадать с физическим. Но проверять версию мало. Главная ошибка — оставить всё обновляемым: штатный apt upgrade меняет ядро, модуль NVIDIA под новое ядро не собирается, и машина уходит в офлайн ночью. А в офлайне вы теряете не деньги за час, а показатель надёжности, по которому площадка решает, показывать вас клиенту или нет.

Поэтому ядро и весь nvidia-стек на наших машинах стоят на apt-mark hold — на клиентском риге это 49 пакетов, причём спутники приходится перечислять явными именами: маска по шаблону там не срабатывает. Для карт 50-й серии добавляется своё: драйвер варианта -open и nvidia_drm.modeset=0 pcie_aspm=off в GRUB. Установка системы с нуля до этого состояния: установку Ubuntu под Vast.ai

2. Канал: считать по видеопамяти, проверять замером

Требование площадки считается от суммарной видеопамяти машины: примерно 2,6 Mbit/s на каждый 1 ГиБ, но не ниже 100 и не выше 500 Mbit/s, отдельно на download и upload. Одиночная RTX 5090 (32 ГБ) даёт по формуле 83 Mbit — срабатывает нижний порог, и такая нода проходит уже с 100/100. Машина 4×RTX 4090 — это 96 ГБ, то есть 250 Mbit. В потолок 500 расчёт упирается примерно с 192 ГБ. Симметричные 500/500 — запас, а не обязательный минимум.

Сравнивать надо не тарифы и не вендоров сетевых карт, а свои замеры. По нашему парку сервер на Realtek 2.5GbE выдаёт 706/625 Mbit, а сервер на Intel I225-V — 524/518: интуиция «Intel лучше Realtek» здесь не работает. Прикинуть свою полосу до площадки можно на проверку канала

Неочевидное про замеры: в каталоге висит не последний результат, а скользящее среднее — новый замер входит в него с весом около 0,1, а сам тест запускается по кроновой лотерее примерно раз в девять часов. После переезда или смены провайдера ждать бессмысленно, замер надо гнать серией вручную. Клиентскую машину мы прогнали десять раз подряд, и только тогда цифра в каталоге дошла до 578/595 Mbit — до этого там месяцами жила скорость со старого адреса.

По портам: хосту выделяется диапазон, который надо пробросить целиком (у нас по тысяче портов на машину). Стоит посмотреть и в обратную сторону: при аудите на одном сервере нашёлся iperf3, открытый наружу на порту 5201 — поставили для замеров и забыли закрыть. Разбор канала в реалиях РФ, включая троттлинг по автономной системе хостера: какой нужен интернет-канал

3. Питание и охлаждение: и что бывает после отключения света

Машина 4×RTX 4090 берёт 2,2–2,4 кВт в пике и устойчиво 1,8–2,0 кВт под нагрузкой. Одна линия 16 А — это 3,7 кВт, то есть ровно один такой сервер: под второй нужна вторая линия со своим автоматом и медью от 2,5 мм². Температуры карт держим ниже 80–83 °C и проверяем на часовом прогоне, а не в простое. ИБП нужен и на роутер, иначе после короткой просадки машина поднимется в сеть, которой нет. Авто-старт после пропадания питания включать в BIOS обязательно: иначе один щелчок автомата превращается в сутки офлайна. Расчёт по электрике: сколько электричества ест сервер

Наш случай из этого пункта. 19 августа 2026 года одну машину обесточило, и вместе с питанием сбросился CMOS. Сервер поднялся сам, карты видны, обычные аренды идут — но клиенты, которым нужен режим виртуальной машины, не стартуют: сброс выключил аппаратную виртуализацию. Ловится одной командой — ls /sys/kernel/iommu_groups: пустой каталог значит, что IOMMU выключен. Поэтому после любого отключения света мы проверяем не «загрузилось ли», а настройки BIOS по списку.

4. Резервный доступ и ключи вместо пароля

С 26 августа 2026 года площадка ежечасно помечает вход по паролю как ошибку конфигурации — формально это мягкое снятие доверия. Перевод парка на ключи — правильный пункт, но порядок в нём жёсткий: сначала убедиться, что вход по ключу работает со второй машины, и только потом выключать пароль. На клиентском риге после этого выяснилась мелочь: привычный PuTTY по паролю туда больше не заходит, нужен отдельный .ppk. В спокойный день это пять минут, в момент аварии — потерянный час.

Второй путь внутрь нужен именно потому, что первый однажды не откроется. У нас это обратный туннель через зарубежный VPS: он же даёт доступ к машине без белого IP и переживает смену адреса домашним провайдером. Как устроено и почему это не дыра: доступ к серверу без белого IP

5. Переходный период с Clore

Главное правило: не гасить старую площадку в тот же день, когда включаете новую. Между «машина зарегистрирована» и «машина прошла verified и начала приходить в выдачу» проходит время, и в этом окне доход не нулевой только если у вас осталась прежняя загрузка. Учтите и другое: смена IP-адреса штрафует показатель надёжности примерно на 0,10, причём только у машин, на которых в этот момент есть аренда, — так что переезд и переключение лучше не совмещать. Сравнение площадок по семи параметрам — сравнение Clore и Vast.ai, полный перенос по шагам — полный разбор перехода

Чем проверять каждый пункт

Что проверяемКоманда или инструментЧто считаем нормой
Карты и драйверnvidia-smi -Lвсе карты в списке, счёт совпадает с физическим
Фиксация пакетовapt-mark showholdядро и весь nvidia-стек (у нас 49 пакетов)
Виртуализацияls /sys/kernel/iommu_groupsнепустой список; пусто = VT-d/IOMMU выключен
Полоса каналаvast.sale/speedcheck, затем свой замер серией≥ 2,6 Mbit на 1 ГиБ VRAM, но не ниже 100/100
Температурыnvidia-smi -q -d TEMPERATURE под нагрузкой< 80–83 °C на часовом прогоне, а не в простое
Линия питаниящиток: автомат и сечение кабеляотдельные 16 А на сервер, медь от 2,5 мм²
Возврат после сбоявыключить питание вводным автоматоммашина сама вернулась в онлайн и в каталог
Оперативная памятьперестановка модулей и swap, не только memtestчас под нагрузкой без ошибок в dmesg
Резервный доступвход по ключу со второй машиныработает до того, как выключен парольный вход
Экономикаvast.sale/calculatorсходится при 50 % оплаченных часов, не при 90 %

Что у нас ломалось в 2026 году

Этот список не для того, чтобы напугать, а для калибровки: такого рода задачи прилетают хосту примерно с такой частотой. Ни одна из них не про «сломался GPU».

  • Мёртвая планка памяти на машине с четырьмя 4090: memtest молчал, доказали перестановкой модулей и swap-ом
  • Залипший контроллер площадки: машина показана неактивной, хотя всё работает. 25 августа так встали четыре рига, 5 сентября — все шесть за день. Лечится сбросом /var/lib/vastai_kaalia/controller_connection, разбор — разбор залипшего контроллера
  • Ежечасный крон площадки стирает флаг VM, если все карты отданы в проброс: одна машина простояла без VM десять дней, с 19:22 11 сентября до 17:04 21 сентября
  • Петля туннеля при старте, до получения адреса по DHCP: 28 тысяч сокетов забили таблицу соединений роутера, и 20 сентября четыре рига ушли на резервный VPS без причины
  • Троттлинг download по автономной системе хостера: у двух крупных провайдеров канал задушен, у нишевого чист. Настройки туннеля тут не помогают, помогает только переезд
  • Зависание агента площадки на блокирующем HTTP-вызове без таймаута: машина живая, в логе последняя строка про обращение к веб-API, наружу не уходит ничего
  • Трафик VM-аренд площадка не тарифицирует: при выставленных $3 за терабайт клиент прокачал 8,32 ТБ за 37 часов, в отчёте — $0.00

Где мы ошиблись

Четыре ошибки, которые стоили нам дохода и которых нет в чужих чек-листах, потому что чужие чек-листы писались не по своим машинам.

  • Поверили memtest. На мёртвой планке он проходил чисто, и причину мы месяцами искали в драйверах и питании. Теперь считаем так: memtest может подтвердить проблему, но не может её опровергнуть.
  • Поставили неверный диагноз карте. Машина с 4090 больше месяца работала без режима VM, потому что отказ мы списали на «неизлечимый reset-баг RTX 4090». Такого бага у неё нет, он относится к картам Blackwell; реальная причина — карта уходила в глубокий сон при отвязке от гостя и не возвращалась, и лечится это правилами устройства. Всё это время мы просто не брали VM-аренды. Процедура целиком: VM-режим на многокарточной машине
  • Сделали автопереход на резервный VPS слишком чувствительным. Порог стоял на трёх неудачных проверках, и 20 сентября обычная помеха домашнего канала увела четыре рига на резерв. Хуже другое: проверка «жив ли второй VPS» была фикцией — туннель отвечал локально за 1–8 мс, и мы принимали это за ответ сервера. Порог поднят до девяти, проверка переделана на настоящую, с ответом за 36–46 мс.
  • Начали работы на клиентской машине, не замерив её канал заранее. Дальше пришлось выправлять скользящее среднее в каталоге серией из десяти прогонов. Замер до начала работ — теперь первый пункт, а не последний.
Если какой-то пункт вызывает вопросы — начните с бесплатной консультации, это дешевле, чем терять дни на простое. Назовите свои карты, тариф на электричество и канал, и мы скажем, какие из перечисленных грабель касаются именно вас: чаще всего это один-два пункта, которые вы проверите сами за вечер. Заявка — наши услуги

И последнее, про порядок. Считать доход имеет смысл до закупки: прикидка по своим картам и своему тарифу — на калькулятор дохода, и берите в ней 50 % оплаченных часов, а не 90 %. Полосу проверьте на проверку канала. Сверить расчёт с живыми деньгами можно на странице «Парк» — витрину нашего парка: доход по каждой нашей машине обновляется раз в час, вместе с простоем и провалами из списка выше. Разбор одного месяца по каждой карте — разбор дохода по каждой карте

Нужна помощь с переходом?

Сделаем настройку под ключ с гарантией запуска.

Смотреть услуги
© Vast Sale · Источник: https://vast.sale/articles/a4
Копирование, пересказ и обработка ИИ-системами допускаются только с сохранением активной ссылки на https://vast.sale