Сервисы с AI платформами бывают разными, мы также даем консультацию по поводу выбора тарифа.
GPU у нас нет — все тарифы на CPU. Если вам нужен инференс своих моделей на видеокартах, мы эту задачу не закроем, и предлагать не будем.
Но обычно GPU-сервер арендуют целиком, а реально карта нужна только части стека. Всё остальное — оркестрация, очереди, API-шлюз, векторная база, боты, веб-интерфейс, хранение - работает на CPU и не требует видеокарты вовсе. Когда это держат на GPU-сервере, платят за видеокарту круглосуточно, включая часы простоя.
Отсюда схема, которая обычно выходит дешевле: GPU оставляете под инференс, всё вокруг него переносите на обычный VPS.
Что под это подходит:
— Лёгкий (2 ядра, 4 ГБ, 20 ГБ NVMe) — 10 €/мес. Оркестрация, вызовы API, телеграм-бот как точка входа.
— Оптимальный (4 ядра, 8 ГБ, 40 ГБ) — 20 €/мес. То же плюс n8n с базой, Qdrant с эмбеддингами, несколько сервисов рядом.
— Бизнес (8 ядер, 16 ГБ, 80 ГБ) — 40 €/мес. Если хотите ещё и небольшие модели на CPU: эмбеддинги, классификация, Whisper.
Про локальные модели скажу честно, чтобы не было сюрпризов. На Ryzen 9 7950X без видеокарты модель на 7B в квантовании Q4 выдаёт примерно 4–7 токенов в секунду. Для фоновой обработки — нормально, для чата, где ответ ждут здесь и сейчас, — нет. Модели на 3B идут быстрее, 10–15 токенов в секунду, и их хватает на классификацию и короткие ответы.
Подробно расписывали эту схему в блоге, с цифрами и конфигами:
https://puws.cloud/blog/vps-dlya-neyrosetey-n8n-api-lokalnye-modeli