// Halo

Llama без собственного хостинга — оплата за запрос на Halo

Открытые модели Llama от Meta, которые раздают независимые операторы. Открытые веса без счёта за GPU — оплата за запрос, без аккаунта.

Llama — семейство открытых моделей Meta, и открытые веса — как раз то, что делает его интересным: эту модель у вас никто не отнимет. Загвоздка в том, что «открытая» не значит «бесплатная в эксплуатации» — GPU всё равно кто-то держит.

На Halo этот «кто-то» — рынок, а не вендор. Независимые операторы раздают Llama наряду с 140+ другими моделями, и вы платите за запрос, а не за час железа.

Открытые веса без счёта за GPU

Самостоятельный хостинг — это аренда или покупка GPU, поддержание стека инференса и оплата всего этого независимо от того, пишете вы один промпт в день или тысячу. На Halo вы платите за запрос в USDC в сети Base, за реально израсходованные токены. Простой не стоит ничего.

Без аккаунта и без API-ключа

Войдите через соцсеть и пишите. Никакой регистрации у поставщика, никаких ключей, которые надо ротировать, и никакой карты на хранении.

Доказательство вместо доверия

Снаружи честная раздача открытой модели и подмена её на что-то подешевле выглядят одинаково — если не проверять. Halo проверяет: каждый результат несёт статистическое доказательство исполнения, а не прошедшее проверку сеть отклоняет.

Можно и раздавать самому

Llama работает на железе, которое у людей уже есть. Если у вас простаивает машина, вы можете оказаться по другую сторону этого рынка — см. что раздавать и тарифы и доход оператора.

Стоит также сравнить: Mistral, DeepSeek и Qwen.

Частые вопросы

Почему бы просто не развернуть Llama самому?

Можно — веса открыты. Но самостоятельный хостинг означает арендованный или собственный GPU, стек инференса, который надо поддерживать, и счёт, который капает независимо от того, пишете вы промпты или нет. Halo даёт ту же открытую модель по запросу, с оплатой за промпт и без эксплуатации.

Какие модели Llama раздаются?

Операторы раздают модели линейки Llama, и доступность меняется по мере их выхода в сеть. Приложение показывает, что раздаётся в конкретный момент, поэтому вы никогда не выбираете из устаревшего списка.

Как понять, что оператор запустил настоящую Llama, а не модель поменьше?

Каждый результат несёт статистическое доказательство исполнения. Подлинная модель даёт примерно 90%+ совпадения распределения токенов с верификатором; подмена или фабрикация выглядит как шум и отклоняется сетью.

Это дешевле хостируемого API?

Часто да, потому что за каждый запрос конкурируют независимые операторы, а не один вендор назначает единственную цену. Вы также платите строго за запрос — без минимума и без простаивающего GPU.