Modelos Abliterated: Custo, Contexto e Código
Os modelos Abliterated são modelos de linguagem de grande porte onde os mecanismos que impõem recusas de segurança foram removidos, permitindo que o modelo responda a perguntas controversas, para adultos ou de nicho sem acionar um filtro de conteúdo. Essa abordagem dá aos desenvolvedores controle total sobre a voz e o corte de conhecimento do modelo, o que é especialmente valioso para codificação, roleplay e escrita criativa, onde as proteções padrão podem bloquear saídas úteis.
Atualizado
Pontos principais
- Os modelos Abliterated usam um único arquivo de pesos onde os comportamentos de recusa são ajustados para serem ignorados, em vez de depender de APIs de moderação externas.
- Nossa API hospedada oferece uma janela de contexto de 100.000 tokens e endpoints compatíveis com OpenAI para integração perfeita.
- A precificação é estritamente pagamento por uso com crédito cripto pré-pago, então você paga apenas pelos tokens realmente consumidos.
- O modelo é uma arquitetura de pesos abertos independente, não uma versão remarcada dos modelos Llama, Mistral ou de outros fornecedores.
O que são Modelos Abliterated?
Os modelos Abliterated são criados ao pegar um modelo de linguagem de pesos abertos existente e remover sistematicamente ou amortecer as vias neurais que causam a recusa de certos tipos de conteúdo. Ao contrário dos modelos padrão que podem recusar educadamente discutir um tópico devido a uma política de segurança, um modelo abliterado responderá à pergunta diretamente. O processo geralmente envolve identificar as 'cabeças de atenção' responsáveis pela recusa e definir sua influência perto de zero, ou ajustar o modelo em um conjunto de dados que incentive respostas abrangentes.
O resultado é um modelo que retém sua inteligência e capacidades de raciocínio básicos, mas não possui a camada de 'filtragem'. Isso significa que ele pode discutir temas adultos, opiniões controversas ou tópicos técnicos de nicho sem gerar uma mensagem de recusa. É importante notar que 'sem censura' não significa 'sem inteligência'; o modelo ainda segue instruções e mantém a coerência. No entanto, ele também pode refletir os vieses ou erros presentes nos dados de treinamento básicos sem o polimento corporativo habitual.
- Integridade do Modelo Base: As habilidades de raciocínio e linguagem principais permanecem intactas.
- Remoção de Recusas: Os mecanismos específicos que acionam filtros de conteúdo são amortecidos.
- Arquivo Único de Pesos: O modelo inteiro, incluindo o estado abliterado, está contido em um único arquivo.
O Custo da Inferência Sem Censura
Executar um modelo sem censura localmente requer hardware significativo, tipicamente uma GPU com pelo menos 24GB de VRAM para modelos de tamanho médio. Para desenvolvedores que precisam de confiabilidade e escala, hospedar o modelo você mesmo introduz sobrecarga operacional. Nossa API oferece um modelo de preços de pagamento por uso previsível que elimina a necessidade de gerenciar GPUs.
Cobramos $0,25 por 1 milhão de tokens de entrada e $1,00 por 1 milhão de tokens de saída. Não há assinaturas mensais ou taxas ocultas. Você pré-carrega crédito usando criptomoedas (USDT na TRC20 ou USDC na Base), e o crédito nunca expira. Erros nas suas requisições são gratuitos, então você paga apenas pelo uso real. Este modelo é ideal para startups ou desenvolvedores independentes que querem testar um modelo sem se comprometer com um custo mensal fixo.
| Tipo de Uso | Custo por 1M de Tokens |
|---|---|
| Tokens de Entrada | $0.25 |
| Tokens de Saída | $1.00 |
Você pode recarregar sua conta com qualquer valor inteiro entre $10 e $500. Se você adicionar $50 ou mais, recebe um bônus de 5% em crédito; adicionar $100 ou mais concede um bônus de 10%. Essa estrutura garante que seus custos de infraestrutura escalem linearmente com o tráfego do seu aplicativo.
Vantagens da Janela de Contexto
Um dos fatores mais críticos para desenvolvedores que trabalham com documentos longos, codebases ou conversas complexas é a janela de contexto. Nossa API fornece uma janela de contexto de 100.000 tokens, o que permite que o modelo processe e retenha uma grande quantidade de informações dentro de uma única requisição. Isso é significativamente maior do que os limites padrão de 8.000 tokens encontrados em muitos modelos mais antigos ou menores.
Uma janela de contexto de 100k permite vários casos de uso avançados. Você pode passar um repositório de código inteiro como contexto, permitindo que o modelo entenda dependências entre arquivos. Você também pode manter conversas longas e coerentes sem que o modelo esqueça instruções anteriores. A janela de contexto inclui tanto o prompt de entrada quanto a conclusão de saída, então você precisa planejar seu orçamento de tokens cuidadosamente.
- Análise de Código: Passe vários arquivos para obter sugestões conscientes do contexto.
- Conversas Longas: Mantenha o estado por dezenas de rodadas sem perder o foco do tópico.
- Resumo de Documentos: Processe grandes blocos de texto em uma única chamada.
Lembre-se de que a saída máxima por requisição é de 32.000 tokens. Se você não especificar o parâmetro max_tokens, o modelo usará 2.048 tokens como padrão. Esse limite garante desempenho estável mesmo ao processar entradas grandes.
Desempenho de Codificação
Modelos sem censura são particularmente valiosos para tarefas de codificação porque têm menos probabilidade de recusar solicitações que possam ser consideradas 'inseguras' pelos filtros padrão. Por exemplo, um modelo padrão pode recusar gerar um payload de injeção SQL para pesquisa de segurança, enquanto um modelo abliterado o fornecerá diretamente. Isso os torna ideais para desenvolvedores que precisam de saída bruta e sem filtros para análise, depuração ou codificação criativa.
O modelo suporta chamada de funções, o que permite definir ferramentas e fazer com que o modelo retorne respostas JSON estruturadas. Isso é essencial para construir agentes de IA que podem interagir com APIs ou bancos de dados externos. Você também pode impor o modo JSON para garantir que a saída do modelo seja sempre JSON válido, o que simplifica a análise no seu aplicativo.
Ao integrar a API, você pode usar os SDKs oficiais da OpenAI ou qualquer cliente compatível com OpenAI. A URL base é https://api.abliterated.cc/v1, e você envia requisições para o endpoint /v1/chat/completions. O ID do modelo é simplesmente uncensored.
Uso de Ferramentas e Chamada de Funções
A chamada de funções é um recurso crítico para construir aplicações práticas de IA. Nossa API suporta isso nativamente, permitindo que você defina um esquema de ferramentas e faça com que o modelo decida qual ferramenta chamar e com quais argumentos. O modelo retorna uma resposta estruturada que você pode analisar e executar no seu código.
Você pode especificar o parâmetro tool_choice para forçar o modelo a chamar uma ferramenta específica ou escolher automaticamente. Essa flexibilidade é útil para criar agentes que podem realizar várias ações, como pesquisar um banco de dados, atualizar um perfil de usuário ou enviar um e-mail.
- Saída Estruturada: Use
response_formatdefinido comojson_objectpara garantir JSON válido. - Definições de Ferramentas: Defina ferramentas no array
toolscom nome, descrição e parâmetros. - Execução: Analise a resposta do modelo e execute a função correspondente no seu código.
A API suporta parâmetros como temperature, top_p, stop, seed, presence_penalty e frequency_penalty para ajustar o comportamento do modelo. Isso permite que você equilibre criatividade e precisão dependendo do seu caso de uso.
Eficiência de Streaming
O streaming é essencial para proporcionar uma boa experiência de usuário em aplicativos de chat. Nossa API suporta Server-Sent Events (SSE), permitindo que você receba a resposta do modelo token por token em tempo real. Isso reduz a latência percebida pelo usuário, pois ele vê a resposta aparecendo gradualmente, em vez de esperar que toda a resposta seja gerada.
Durante o streaming, a API inclui informações de uso de tokens no último chunk. Isso permite que você acompanhe o consumo de tokens em tempo real e interrompa o streaming se estiver se aproximando dos limites do seu orçamento. A interface de streaming é compatível com todos os SDKs padrão do OpenAI, facilitando a integração em aplicativos existentes.
Uma consideração a considerar é que o streaming às vezes pode resultar em contagens de tokens ligeiramente maiores em comparação com requisições sem streaming, pois o modelo pode gerar palavras de preenchimento ou hesitar. No entanto, o benefício do feedback imediato geralmente supera esse custo menor. Você também pode usar o parâmetro stop para interromper a geração antecipadamente se o modelo começar a se repetir ou sair do tópico.
Privacidade de Dados e Treinamento
Para muitos desenvolvedores, a privacidade de dados é uma preocupação primordial. Ao usar nossa API, seus prompts não são usados para treinamento. Isso significa que os dados que você envia para o modelo permanecem privados e não são usados para melhorar o modelo base nem compartilhados com terceiros. Essa é uma vantagem significativa em comparação com alguns grandes fornecedores que usam dados de clientes para treinamento.
Para se cadastrar, você só precisa de um endereço de e-mail. Você pode entrar com Google ou usar um e-mail e senha. Nenhum número de telefone é necessário, e nenhum cartão de crédito é necessário para o teste. O teste inclui $0,50 de crédito válido por 7 dias, permitindo que você teste a API antes de se comprometer com um plano pago.
Existe um limite de conteúdo rígido que sempre se aplica: o modelo recusará requisições envolvendo conteúdo sexual com menores. Todos os outros tópicos adultos, controversos ou de nicho permitidos pela lei são aceitos. Isso garante que o modelo permaneça utilizável para uma ampla gama de aplicativos sem restrições inesperadas.
Por que escolher uma API em vez de rodar localmente?
Executar um modelo localmente oferece controle total sobre os dados e a infraestrutura, mas exige hardware significativo e conhecimento técnico. Você precisa gerenciar drivers de GPU, alocação de memória e atualizações do modelo. Para muitos desenvolvedores, especialmente aqueles que criam protótipos ou aplicativos de pequena escala, essa sobrecarga não vale a pena.
Nossa API fornece uma solução hospedada que cuida de toda a infraestrutura. Você obtém um endpoint confiável e escalável com preços previsíveis. A API suporta 300 requisições por minuto e até 8 requisições simultâneas por chave, o que é suficiente para a maioria dos aplicativos de pequeno a médio porte. Se você precisar de limites mais altos, pode entrar em contato com o suporte.
Outra vantagem é a facilidade de integração. Você pode usar o mesmo código que usaria para o GPT-4, apenas alterando a URL base e a chave de API. Isso reduz a curva de aprendizado e permite que você alterne entre modelos, se necessário. A API não está vinculada a nenhum fornecedor específico, então você não fica preso a um único ecossistema.
Começando com Abliterated
Começar a usar nossa API é simples. Primeiro, crie uma conta usando seu e-mail ou Google. Você receberá uma chave de API imediatamente, que pode ser usada para autenticar suas requisições. Você também pode usar o crédito de teste para testar a API sem inserir informações de pagamento.
Para fazer sua primeira requisição, use o método POST no endpoint /v1/chat/completions. Defina o parâmetro model como uncensored e inclua seu prompt no array messages. Você também pode especificar parâmetros como temperature e max_tokens para controlar a saída.
Perguntas e respostas
Este modelo é baseado em Llama ou Mistral?
Não. O modelo é uma arquitetura de pesos abertos independente. Não é GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama ou qualquer outro modelo de fornecedor. É um modelo único ajustado para comportamento sem censura.
Posso usar a API com os SDKs oficiais do OpenAI?
Sim. A API é totalmente compatível com o OpenAI. Você pode usar os SDKs oficiais do OpenAI ou qualquer cliente que suporte o formato da API do OpenAI, definindo a URL base para https://api.abliterated.cc/v1 e fornecendo sua chave de API.
Como pago pela API?
Aceitamos apenas criptomoedas: USDT na rede TRC20 ou USDC na rede Base. Você pode recarregar com qualquer valor inteiro entre $10 e $500. Não há assinaturas mensais nem cobranças em cartão de crédito.
Qual é o tamanho da janela de contexto?
A janela de contexto é de 100.000 tokens, o que inclui tanto o prompt de entrada quanto a conclusão de saída. A saída máxima por requisição é de 32.000 tokens, ou 2.048 tokens se você não especificar um parâmetro max_tokens.
Sua chave está a um formulário de distância
Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.