Модели Abliterated: Стоимость, контекст и код
Abliterated — это большие языковые модели, в которых убраны механизмы отказа, что позволяет модели отвечать на вопросы по спорным, взрослым или узкоспециализированным темам без срабатывания фильтра контента. Такой подход даёт разработчикам полный контроль над тоном и границей знаний модели, что особенно ценно для программирования, ролевых игр и креативного письма, где стандартные ограничения могут блокировать полезный вывод.
Обновлено
Ключевые моменты
- Модели Abliterated используют единый файл весов, в котором поведение при отказе настроено на отключение, а не полагается на внешние API модерации.
- Наше хостинговое API предоставляет контекстное окно на 100 000 токенов и эндпоинты, совместимые с OpenAI, для бесшовной интеграции.
- Ценообразование строго по факту использования с предоплаченным балансом криптовалюты, поэтому вы платите только за фактически потребленные токены.
- Модель — независимая архитектура с открытыми весами, а не переупакованная версия моделей Llama, Mistral или других вендоров.
Что такое модели Abliterated?
Модели Abliterated создаются на основе существующей модели с открытыми весами путем систематического удаления или ослабления нейронных связей, которые вызывают отказ от определенных типов контента. В отличие от стандартных моделей, которые могут вежливо отказаться обсуждать тему из-за политики безопасности, абалитированная модель ответит на вопрос напрямую. Процесс обычно включает выявление «голов внимания», ответственных за отказ, и установку их влияния на уровень, близкий к нулю, или дообучение модели на наборе данных, поощряющем всесторонние ответы.
Результатом является модель, сохраняющая базовый интеллект и способности к рассуждению, но лишенная слоя «фильтрации». Это означает, что она может обсуждать взрослые темы, противоречивые мнения или узкоспециализированные технические вопросы без генерации сообщения об отказе. Важно отметить, что «без цензуры» не означает «неинтеллектуальная»; модель по-прежнему выполняет инструкции и сохраняет связность. Однако она также может отражать предвзятость или ошибки, присутствующие в исходных обучающих данных, без обычной корпоративной обработки.
- Целостность базовой модели: Базовые навыки рассуждения и языка остаются intact.
- Удаление отказов: Специфические механизмы, запускающие фильтры контента, ослаблены.
- Один файл весов: Вся модель, включая состояние аблитерации, содержится в одном файле.
Стоимость инференса без цензуры
Запуск модели без цензуры локально требует значительных аппаратных ресурсов, обычно GPU с как минимум 24 ГБ видеопамяти для моделей среднего размера. Для разработчиков, которым нужна надежность и масштабируемость, самостоятельный хостинг модели создает операционные издержки. Наш API предлагает предсказуемую модель ценообразования с оплатой за использование, которая устраняет необходимость управления GPU.
Мы берем $0,25 за 1 миллион входных токенов и $1,00 за 1 миллион выходных токенов. Нет ежемесячных подписок или скрытых комиссий. Вы пополняете баланс криптовалютой (USDT в сети TRC20 или USDC в сети Base), и кредит не сгорает. Ошибки в ваших запросах бесплатны, поэтому вы платите только за фактическое использование. Эта модель идеально подходит для стартапов или инди-разработчиков, которые хотят протестировать модель, не фиксируя ежемесячные расходы.
| Тип использования | Стоимость за 1 млн токенов |
|---|---|
| Входные токены | $0.25 |
| Выходные токены | $1.00 |
Вы можете пополнить счет на любую целую сумму от $10 до $500. Если вы добавите $50 или больше, вы получите бонус 5% к кредиту; добавление $100 или больше дает бонус 10%. Такая структура гарантирует, что ваши инфраструктурные расходы масштабируются линейно в зависимости от трафика вашего приложения.
Преимущества контекстного окна
Одним из наиболее критических факторов для разработчиков, работающих с длинными документами, базами кода или сложными разговорами, является контекстное окно. Наше API предоставляет контекстное окно на 100 000 токенов, что позволяет модели обрабатывать и сохранять большое количество информации в рамках одного запроса. Это значительно больше, чем стандартные ограничения в 8 000 токенов, встречающиеся во многих старых или меньших моделях.
Контекстное окно на 100 000 токенов позволяет реализовать несколько продвинутых сценариев. Вы можете передать весь репозиторий кода в качестве контекста, что позволяет модели понимать зависимости между файлами. Вы также можете поддерживать длинные связные разговоры, не теряя предыдущие инструкции. Контекстное окно включает как входной промпт, так и завершение вывода, поэтому вам нужно тщательно планировать бюджет токенов.
- Анализ кода: Передавайте несколько файлов для получения контекстно-зависимых предложений.
- Длинные разговоры: Поддерживайте состояние на протяжении десятков ходов, не теряя тему.
- Суммаризация документов: Обрабатывайте большие блоки текста за один вызов.
Имейте в виду, что максимальный объем вывода на запрос составляет 32 000 токенов. Если вы не укажете параметр max_tokens, модель будет использовать значение по умолчанию 2 048 токенов. Это ограничение обеспечивает стабильную производительность даже при обработке больших входных данных.
Производительность при программировании
Модели без цензуры особенно ценны для задач программирования, поскольку они с меньшей вероятностью откажут в запросах, которые стандартные фильтры могут посчитать «небезопасными». Например, стандартная модель может отказаться генерировать payload для SQL-инъекции для целей исследования безопасности, в то время как аблитерированная модель предоставит его напрямую. Это делает их идеальными для разработчиков, которым нужен сырой, нефильтрованный вывод для анализа, отладки или творческого программирования.
Модель поддерживает вызов функций, что позволяет определять инструменты и получать от модели структурированные ответы в формате JSON. Это необходимо для создания AI-агентов, которые могут взаимодействовать с внешними API или базами данных. Вы также можете включить JSON-режим, чтобы гарантировать, что вывод модели всегда является действительным JSON, что упрощает парсинг в вашем приложении.
При интеграции API вы можете использовать официальные SDK OpenAI или любой клиент, совместимый с OpenAI. Базовый URL — https://api.abliterated.cc/v1, а запросы отправляются на эндпоинт /v1/chat/completions. Идентификатор модели — просто uncensored.
Использование инструментов и вызов функций
Вызов функций — важная функция для создания практических ИИ-приложений. Наш API поддерживает эту функцию нативно, позволяя вам определить схему инструментов и предоставить модели возможность решить, какой инструмент вызвать и с какими аргументами. Модель возвращает структурированный ответ, который вы можете разобрать и выполнить в своем коде.
Вы можете указать параметр tool_choice, чтобы заставить модель вызвать конкретный инструмент или выбрать автоматически. Эта гибкость полезна для создания агентов, которые могут выполнять несколько действий, таких как поиск в базе данных, обновление профиля пользователя или отправка электронной почты.
- Структурированный вывод: Используйте
response_formatсо значениемjson_objectдля получения корректного JSON. - Определения инструментов: Определите инструменты в массиве
toolsс именем, описанием и параметрами. - Выполнение: Распарсите ответ модели и выполните соответствующую функцию в своем коде.
API поддерживает параметры, такие как temperature, top_p, stop, seed, presence_penalty и frequency_penalty для тонкой настройки поведения модели. Это позволяет вам балансировать между креативностью и точностью в зависимости от вашей задачи.
Эффективность потоковой передачи
Потоковая передача необходима для обеспечения хорошего пользовательского опыта в чат-приложениях. Наш API поддерживает Server-Sent Events (SSE), позволяя получать ответ модели токен за токеном в реальном времени. Это снижает воспринимаемую задержку для пользователя, так как он видит, как ответ появляется постепенно, а не ожидает генерации всего ответа.
При потоковой передаче API включает информацию об использовании токенов в последнем блоке. Это позволяет отслеживать потребление токенов в реальном времени и останавливать поток, если вы приближаетесь к лимиту бюджета. Интерфейс потоковой передачи совместим со всеми стандартными SDK OpenAI, что упрощает интеграцию в существующие приложения.
Один из компромиссов заключается в том, что потоковая передача иногда приводит к немного большему количеству токенов по сравнению с запросами без потоковой передачи, так как модель может генерировать слова-заполнители или колебаться. Однако преимущество немедленной обратной связи часто перевешивает эти небольшие издержки. Вы также можете использовать параметр stop, чтобы остановить генерацию досрочно, если модель начнет повторяться или отклоняться от темы.
Конфиденциальность данных и обучение
Для многих разработчиков конфиденциальность данных является главным приоритетом. При использовании нашего API ваши промпты не используются для обучения. Это означает, что данные, которые вы отправляете в модель, остаются приватными и не используются для улучшения базовой модели или передачи третьим лицам. Это значительное преимущество перед некоторыми крупными поставщиками, которые используют данные клиентов для обучения.
Для регистрации вам нужен только адрес электронной почты. Вы можете войти через Google или с помощью адреса электронной почты и пароля. Номер телефона не требуется, и для пробного периода не нужна кредитная карта. Пробный период включает предоплаченный баланс в размере $0,50, действительный в течение 7 дней, что позволяет протестировать API перед переходом на платный тариф.
Существует одно жесткое ограничение контента, которое всегда применяется: модель откажет в запросах, связанных с сексуальным контентом с участием несовершеннолетних. Все остальные законные взрослые, противоречивые или узкоспециализированные темы разрешены. Это гарантирует, что модель остается пригодной для широкого спектра приложений без неожиданных ограничений.
Почему стоит выбрать API вместо локального решения?
Запуск модели локально дает вам полный контроль над данными и инфраструктурой, но требует значительных аппаратных ресурсов и технических знаний. Вам нужно управлять драйверами GPU, распределением памяти и обновлениями модели. Для многих разработчиков, особенно тех, кто создает прототипы или приложения малого масштаба, эти накладные расходы не стоят того.
Наш API предоставляет размещенное решение, которое берет на себя всю инфраструктуру. Вы получаете надежный, масштабируемый эндпоинт с предсказуемым ценообразованием. API поддерживает 300 запросов в минуту и до 8 параллельных запросов на ключ, чего достаточно для большинства приложений малого и среднего размера. Если вам нужны более высокие лимиты, вы можете связаться со службой поддержки.
Еще одно преимущество — простота интеграции. Вы можете использовать тот же код, который использовали бы для GPT-4, просто изменив базовый URL и API-ключ. Это снижает кривую обучения и позволяет вам переключаться между моделями при необходимости. API не привязан к какому-либо конкретному поставщику, поэтому вы не привязаны к одной экосистеме.
Начало работы с Abliterated
Начать работу с нашим API просто. Сначала зарегистрируйте учетную запись, используя свой адрес электронной почты или Google. Вы сразу получите API-ключ, который можете использовать для аутентификации запросов. Вы также можете использовать пробный кредит для тестирования API без ввода платежной информации.
Чтобы сделать первый запрос, используйте метод POST на эндпоинте /v1/chat/completions. Установите параметр model в значение uncensored и включите свой промпт в массив messages. Вы также можете указать параметры, такие как temperature и max_tokens, чтобы контролировать вывод.
Вопросы и ответы
Эта модель основана на Llama или Mistral?
Нет. Модель — это независимая архитектура с открытыми весами. Это не GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama или какая-либо другая модель поставщика. Это уникальная модель, настроенная на поведение без цензуры.
Могу ли я использовать API с официальными SDK OpenAI?
Да. API полностью совместим с OpenAI. Вы можете использовать официальные SDK OpenAI или любой клиент, поддерживающий формат API OpenAI, установив базовый URL на https://api.abliterated.cc/v1 и предоставив свой API-ключ.
Как оплатить API?
Мы принимаем только криптовалюту: USDT в сети TRC20 или USDC в сети Base. Вы можете пополнить баланс любой целой суммой от $10 до $500. Ежемесячных подписок или списаний с кредитных карт нет.
Какой размер контекстного окна?
Контекстное окно составляет 100 000 токенов, что включает как входной промпт, так и завершение вывода. Максимальный объем вывода на запрос составляет 32 000 токенов или 2 048 токенов, если вы не указали параметр max_tokens.
Ваш ключ — в одной форме от вас
Создайте учетную запись, скопируйте ключ, измените базовый URL. Вот и вся настройка.