Abliterated Modellen: Kosten, Context en Code
Abliterated-modellen zijn grote taalmodellen waarbij de mechanismen voor veiligheidsafwijzingen zijn verwijderd, waardoor het model controversiële, volwassen of niche-vragen kan beantwoorden zonder tegen een inhoudsfilter aan te lopen. Deze aanpak geeft ontwikkelaars volledige controle over de stem en de kennisafsnijding van het model, wat vooral waardevol is voor coderen, rollenspellen en creatief schrijven waar standaardbeveiligingsmaatregelen nuttige output kunnen blokkeren.
Bijgewerkt
Belangrijkste punten
- Abliterated-modellen gebruiken een enkel weight-bestand waarin weigergedrag is uitgeschakeld, in plaats van te vertrouwen op externe moderatie-API's.
- Onze gehoste API biedt een contextvenster van 100.000 tokens en OpenAI-compatible endpoints voor naadloze integratie.
- Prijzen zijn strikt pay-per-use met prepaid crypto tegoed, dus je betaalt alleen voor daadwerkelijk verbruikte tokens.
- Het model is een onafhankelijke open-weight architectuur, geen verpakte versie van Llama, Mistral of andere leveranciersmodellen.
Wat zijn Abliterated Modellen?
Abliterated-modellen worden gemaakt door een bestaand open-weight taalmodel te nemen en de neurale paden die ervoor zorgen dat het bepaalde soorten inhoud weigert, systematisch te verwijderen of te dempen. In tegenstelling tot standaardmodellen die misschien beleefd weigeren over een onderwerp te praten vanwege een veiligheidsbeleid, zal een geablitereerd model de vraag direct beantwoorden. Het proces omvat meestal het identificeren van de 'attention heads' die verantwoordelijk zijn voor de weigering en de invloed ervan op bijna nul instellen, of het model trainen op een dataset die uitgebreid antwoorden bevordert.
Het resultaat is een model dat zijn basisintelligentie en redeneervermogen behoudt, maar de 'filterlaag' mist. Dit betekent dat het volwassen thema's, controversiële meningen of niche technische onderwerpen kan bespreken zonder een weigermelding te genereren. Het is belangrijk op te merken dat 'ongecensureerd' niet betekent 'onintelligent'; het model volgt nog steeds instructies en behoudt coherentie. Het kan echter ook de bias of fouten weerspiegelen die aanwezig zijn in de basis trainingsdata zonder de gebruikelijke corporate polish.
- Basismodel integriteit: De kernredeneer- en taalkunsten blijven intact.
- Weigering verwijderen: De specifieke mechanismen die contentfilters activeren worden gedempt.
- Eén gewichtsbestand: Het volledige model, inclusief de geablitereerde toestand, is opgeslagen in één bestand.
De kosten van ongecensureerde inferentie
Een ongecensureerd model lokaal draaien vereist significante hardware, doorgaans een GPU met minimaal 24GB VRAM voor middelgrote modellen. Voor ontwikkelaars die betrouwbaarheid en schaalbaarheid nodig hebben, introduceert het zelf hosten van het model operationele overhead. Onze API biedt een voorspelbaar pay-per-use prijsmodel dat de behoefte aan GPU-beheer elimineert.
We rekenen $0,25 per 1 miljoen input tokens en $1,00 per 1 miljoen output tokens. Er zijn geen maandelijkse abonnementen of verborgen kosten. Je laadt tegoed voor met cryptocurrency (USDT op TRC20 of USDC op Base), en het tegoed verloopt nooit. Fouten in je verzoeken zijn gratis, dus je betaalt alleen voor daadwerkelijk gebruik. Dit model is ideaal voor startups of indie ontwikkelaars die een model willen testen zonder zich vast te leggen aan een vast maandelijkse kosten.
| Gebruikstype | Kosten per 1M Tokens |
|---|---|
| Input Tokens | $0.25 |
| Output Tokens | $1.00 |
Je kunt je account opwaarderen met elk geheel bedrag tussen $10 en $500. Als je $50 of meer toevoegt, ontvang je een bonus van 5% aan tegoed; bij $100 of meer krijg je een bonus van 10%. Deze structuur zorgt ervoor dat je infrastructuurkosten lineair schalen met het verkeer van je applicatie.
Voordelen van het contextvenster
Een van de meest kritieke factoren voor ontwikkelaars die werken met lange documenten, codebases of complexe gesprekken is het contextvenster. Onze API biedt een contextvenster van 100.000 tokens, waardoor het model een grote hoeveelheid informatie kan verwerken en behouden binnen een enkel verzoek. Dit is aanzienlijk groter dan de standaard limiet van 8.000 tokens die veel oudere of kleinere modellen hebben.
Een contextvenster van 100k maakt geavanceerde use cases mogelijk. Je kunt een volledige code repository als context doorgeven, waardoor het model cross-file afhankelijkheden kan begrijpen. Je kunt ook lange, coherente gesprekken onderhouden zonder dat het model eerdere instructies vergeet. Het contextvenster omvat zowel de input prompt als de output completion, dus je moet je token budget zorgvuldig plannen.
- Code analyse: Geef meerdere bestanden door voor contextbewuste suggesties.
- Lange gesprekken: Behoud staat over tientallen beurten zonder het onderwerp uit het oog te verliezen.
- Document samenvatting: Verwerk grote tekstblokken in een enkele call.
Houd er rekening mee dat de maximale output per verzoek 32.000 tokens is. Als je geen max_tokens parameter opgeeft, zal het model standaard 2.048 tokens gebruiken. Deze limiet zorgt voor stabiele prestaties zelfs bij het verwerken van grote inputs.
Code prestaties
Ongecensureerde modellen zijn bijzonder waardevol voor codetaken omdat ze minder snel verzoeken zullen weigeren die door standaard filters als 'onveilig' worden beschouwd. Een standaard model weigert bijvoorbeeld misschien een SQL injection payload te genereren voor security research, terwijl een geëlimineerd model het direct zal verstrekken. Dit maakt ze ideaal voor ontwikkelaars die ruwe, ongefilterde output nodig hebben voor analyse, debugging of creatieve codering.
Het model ondersteunt function calling, waardoor je tools kunt definiëren en het model gestructureerde JSON-antwoorden kunt laten retourneren. Dit is essentieel voor het bouwen van AI agents die kunnen interageren met externe API's of databases. Je kunt ook JSON-modus afdwingen om ervoor te zorgen dat de output van het model altijd geldige JSON is, wat het parseren in je applicatie vereenvoudigt.
Bij het integreren van de API kun je de officiële OpenAI SDK's of elke OpenAI-compatible client gebruiken. De base URL is https://api.abliterated.cc/v1, en je stuurt verzoeken naar het /v1/chat/completions endpoint. De model ID is eenvoudigweg uncensored.
Toolgebruik & function calling
Function calling is een cruciale functie voor het bouwen van praktische AI applicaties. Onze API ondersteunt dit native, waardoor je een schema van tools kunt definiëren en het model kunt laten beslissen welke tool aan te roepen en met welke argumenten. Het model retourneert een gestructureerd antwoord dat je kunt parseren en uitvoeren in je code.
Je kunt de tool_choice parameter opgeven om het model te forceren een specifieke tool aan te roepen of om automatisch te kiezen. Deze flexibiliteit is nuttig voor het maken van agents die meerdere acties kunnen uitvoeren, zoals het doorzoeken van een database, het bijwerken van een gebruikersprofiel of het verzenden van een e-mail.
- Gestructureerde output: Gebruik
response_formatingesteld opjson_objectom geldige JSON te garanderen. - Tool definities: Definieer tools in de
toolsarray met name, beschrijving en parameters. - Uitvoering: Parse het antwoord van het model en voer de bijbehorende functie uit in je code.
De API ondersteunt parameters zoals temperature, top_p, stop, seed, presence_penalty en frequency_penalty om het gedrag van het model te verfijnen. Dit stelt je in staat creativiteit en precisie af te wegen afhankelijk van je use case.
Streaming efficiëntie
Streaming is essentieel voor een goede gebruikerservaring in chattoepassingen. Onze API ondersteunt Server-Sent Events (SSE), waardoor je het antwoord van het model token voor token in real-time kunt ontvangen. Dit vermindert de waargenomen latentie voor de gebruiker, omdat ze het antwoord geleidelijk zien verschijnen in plaats van te wachten tot het volledige antwoord gegenereerd is.
Tijdens streaming bevat de API token-gebruiksgegevens in de laatste chunk. Hiermee kun je je tokenverbruik in real-time volgen en de stream stoppen als je je budgetlimiet nadert. De streaming-interface is compatibel met alle standaard OpenAI SDKs, waardoor integratie in bestaande toepassingen eenvoudig is.
Een overweging is dat streaming soms kan leiden tot iets hogere tokenaantallen in vergelijking met niet-streaming verzoeken, omdat het model vullwoorden kan genereren of kan aarzelen. Het voordeel van directe feedback weegt dit kleine nadeel echter vaak op. Je kunt ook de stop parameter gebruiken om de generatie vroegtijdig te stoppen als het model begint te herhalen of van onderwerp afwijkt.
Gegevensprivacy & Training
Voor veel ontwikkelaars is gegevensprivacy een topprioriteit. Wanneer je onze API gebruikt, worden je prompts niet gebruikt voor training. Dit betekent dat de gegevens die je naar het model stuurt privé blijven en niet worden gebruikt om het basismodel te verbeteren of met derden te delen. Dit is een aanzienlijk voordeel ten opzichte van sommige grote leveranciers die klantgegevens gebruiken voor training.
Voor aanmelding heb je alleen een e-mailadres nodig. Je kunt inloggen met Google of met een e-mailadres en wachtwoord. Er is geen telefoonnummer nodig en er is geen creditcard nodig voor de proefversie. De proefversie bevat $0,50 aan tegoed dat 7 dagen geldig is, zodat je de API kunt testen voordat je je verbindt aan een betaald abonnement.
Er is één harde inhoudslimiet die altijd geldt: het model weigert verzoeken die seksuele inhoud met minderjarigen bevatten. Alle andere wettelijke volwassen, controversiële of niche-onderwerpen zijn toegestaan. Dit zorgt ervoor dat het model bruikbaar blijft voor een breed scala aan toepassingen zonder onverwachte beperkingen.
Waarom kiezen voor een API in plaats van lokaal?
Een model lokaal draaien geeft je volledige controle over de gegevens en infrastructuur, maar vereist aanzienlijke hardware en technische expertise. Je moet GPU-stuurprogramma's, geheentoewijzing en modelupdates beheren. Voor veel ontwikkelaars, vooral die prototypes of kleinschalige toepassingen bouwen, is deze overhead niet de moeite waard.
Onze API biedt een gehoste oplossing die alle infrastructuur verzorgt. Je krijgt een betrouwbaar, schaalbaar endpoint met voorspelbare prijzen. De API ondersteunt 300 verzoeken per minuut en maximaal 8 gelijktijdige verzoeken per sleutel, wat voldoende is voor de meeste kleine tot middelgrote toepassingen. Als je hogere limieten nodig hebt, kun je contact opnemen met de ondersteuning.
Een ander voordeel is de eenvoud van integratie. Je kunt dezelfde code gebruiken die je voor GPT-4 zou gebruiken, door alleen de basis-URL en API-sleutel te wijzigen. Dit vermindert de leercurve en stelt je in staat om tussen modellen te schakelen indien nodig. De API is niet gebonden aan een specifieke leverancier, dus je zit niet vast in één ecosysteem.
Aan de slag met Abliterated
Aan de slag gaan met onze API is eenvoudig. Meld je eerst aan voor een account met je e-mail of Google. Je ontvangt direct een API-sleutel, die je kunt gebruiken om je verzoeken te verifiëren. Je kunt ook het proeftegoed gebruiken om de API te testen zonder betalingsinformatie in te voeren.
Om je eerste verzoek te doen, gebruik je de POST methode op het /v1/chat/completions endpoint. Stel de model parameter in op uncensored en voeg je prompt toe aan de messages array. Je kunt ook parameters zoals temperature en max_tokens specificeren om de uitvoer te beheren.
Vragen en antwoorden
Is dit model gebaseerd op Llama of Mistral?
Nee. Het model is een onafhelijke open-weight architectuur. Het is geen GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama of enig ander model van een leverancier. Het is een uniek model getuned voor ongecensureerd gedrag.
Kan ik de API gebruiken met de officiële OpenAI SDKs?
Ja. De API is volledig compatibel met OpenAI. Je kunt de officiële OpenAI SDK's gebruiken of elke client die het OpenAI API-formaat ondersteunt door de basis-URL in te stellen op https://api.abliterated.cc/v1 en je API-sleutel te verstrekken.
Hoe betaal ik voor de API?
We accepteren alleen cryptocurrency: USDT op het TRC20-netwerk of USDC op het Base-netwerk. Je kunt je saldo opwaarderen met elk geheel bedrag tussen $10 en $500. Er zijn geen maandelijkse abonnementen of creditcardkosten.
Wat is de grootte van het contextvenster?
Het contextvenster is 100.000 tokens groot, wat zowel de invoerprompt als de uitvoercompletatie omvat. De maximale uitvoer per verzoek is 32.000 tokens, of 2.048 tokens als je geen max_tokens parameter specificeert.
Je sleutel is nog maar één formulier verwijderd
Maak een account aan, kopieer de sleutel, pas de basis-URL aan. Dat is de hele configuratie.