Abliterated-Modelle: Kosten, Kontext und Code
Abliterated-Modelle sind große Sprachmodelle, bei denen die Mechanismen zur Erzwingung von Sicherheitsablehnungen entfernt wurden, sodass das Modell kontroverse, erwachsene oder Nischenfragen beantworten kann, ohne auf einen Inhaltsfilter zu stoßen. Dieser Ansatz gibt Entwicklern die volle Kontrolle über die Stimme und den Wissensstand des Modells, was besonders für Coding, Rollenspiele und kreatives Schreiben wertvoll ist, bei dem Standard-Sicherheitsmechanismen nützliche Ausgaben blockieren könnten.
Aktualisiert
Wichtige Punkte
- Abliterated-Modelle verwenden eine einzelne Gewichtungsdatei, bei der Ablehnungsverhalten herausgefiltert wird, anstatt sich auf externe Moderations-APIs zu verlassen.
- Unsere gehostete API bietet ein Kontextfenster mit 100.000 Token und OpenAI-kompatible Endpunkte für eine nahtlose Integration.
- Die Preise sind strikt nutzungsbasiert mit Prepaid-Krypto-Guthaben, sodass du nur für tatsächlich verbrauchte Token zahlst.
- Das Modell ist eine unabhängige Open-Weight-Architektur und keine neu verpackte Version von Llama, Mistral oder anderen Anbietermodellen.
Was sind Abliterated-Modelle?
Abliterated-Modelle werden erstellt, indem ein vorhandenes Open-Weight-Sprachmodell genommen und die neuronalen Pfade, die zu bestimmten Inhaltsablehnungen führen, systematisch entfernt oder abgeschwächt werden. Im Gegensatz zu Standardmodellen, die ein Thema aus Sicherheitsgründen höflich ablehnen könnten, beantwortet ein ablitiertes Modell die Frage direkt. Der Prozess umfasst typischerweise das Identifizieren der für die Ablehnung zuständigen 'Attention Heads' und das Setzen ihres Einflusses auf nahezu null oder das Feinabstimmen des Modells mit einem Datensatz, der umfassende Antworten fördert.
Das Ergebnis ist ein Modell, das seine grundlegende Intelligenz und seine Fähigkeiten zur Problemlösung behält, aber die 'Filter'-Schicht nicht mehr hat. Das bedeutet, dass es über erwachsene Themen, kontroverse Meinungen oder Nischenthemen sprechen kann, ohne eine Ablehnungsmeldung zu generieren. Es ist wichtig zu beachten, dass 'unzensiert' nicht 'unintelligent' bedeutet; das Modell befolgt immer noch Anweisungen und behält die Kohärenz bei. Es kann jedoch auch die Verzerrungen oder Fehler widerspiegeln, die in den Basis-Trainingsdaten vorhanden sind, ohne die übliche Unternehmenspolitur.
- Integrität des Basismodells: Die Kernfähigkeiten für Logik und Sprache bleiben erhalten.
- Entfernung der Ablehnung: Die spezifischen Mechanismen, die Inhaltsfilter auslösen, werden abgeschwächt.
- Einzelne Gewichtungsdatei: Das gesamte Modell, einschließlich des ablitierten Zustands, befindet sich in einer einzigen Datei.
Die Kosten für unzensierte Inferenz
Das Ausführen eines unzensierten Modells lokal erfordert erhebliche Hardware, typischerweise eine GPU mit mindestens 24 GB VRAM für mittelgroße Modelle. Für Entwickler, die Zuverlässigkeit und Skalierbarkeit benötigen, führt das Selbsthosten des Modells zu Betriebsaufwand. Unsere API bietet ein vorhersehbares Preismodell nach Nutzung, das die Verwaltung von GPUs überflüssig macht.
Wir berechnen 0,25 $ pro 1 Million Eingabetoken und 1,00 $ pro 1 Million Ausgabetoken. Es gibt keine monatlichen Abonnements oder versteckten Gebühren. Du lädst Guthaben mit Kryptowährungen (USDT auf TRC20 oder USDC auf Base) auf, und das Guthaben verfällt nie. Fehler in deinen Anfragen sind kostenlos, sodass du nur für die tatsächliche Nutzung zahlst. Dieses Modell ist ideal für Startups oder Indie-Entwickler, die ein Modell testen möchten, ohne sich an feste monatliche Kosten zu binden.
| Nutzungsart | Kosten pro 1M Token |
|---|---|
| Eingabetoken | $0.25 |
| Ausgabetoken | $1.00 |
Du kannst dein Konto mit jedem beliebigen ganzzahligen Betrag zwischen $10 und $500 aufladen. Wenn du $50 oder mehr hinzufügst, erhältst du einen Bonus von 5 %; bei $100 oder mehr gewähren wir einen Bonus von 10 %. Diese Struktur stellt sicher, dass deine Infrastrukturkosten linear mit dem Traffic deiner Anwendung skalieren.
Vorteile des Kontextfensters
Einer der kritischsten Faktoren für Entwickler, die mit langen Dokumenten, Codebasen oder komplexen Unterhaltungen arbeiten, ist das Kontextfenster. Unsere API bietet ein Kontextfenster mit 100.000 Token, das es dem Modell ermöglicht, eine große Menge an Informationen innerhalb einer einzelnen Anfrage zu verarbeiten und zu behalten. Dies ist deutlich größer als die Standardgrenzen von 8.000 Token, die bei vielen älteren oder kleineren Modellen zu finden sind.
Ein Kontextfenster mit 100k ermöglicht mehrere erweiterte Anwendungsfälle. Du kannst ein gesamtes Code-Repository als Kontext übergeben, sodass das Modell dateiübergreifende Abhängigkeiten verstehen kann. Du kannst auch lange, kohärente Gespräche führen, ohne dass das Modell frühere Anweisungen vergisst. Das Kontextfenster umfasst sowohl den Eingabe-Prompt als auch die Ausgabe-Vervollständigung, daher musst du dein Token-Budget sorgfältig planen.
- Code-Analyse: Übergebe mehrere Dateien, um kontextbewusste Vorschläge zu erhalten.
- Lange Unterhaltungen: Halte den Status über Dutzende von Durchgängen aufrecht, ohne den Faden der Unterhaltung zu verlieren.
- Zusammenfassung von Dokumenten: Verarbeite große Textblöcke in einem einzigen Aufruf.
Behalte im Hinterkopf, dass die maximale Ausgabe pro Anfrage 32.000 Token beträgt. Wenn du den Parameter max_tokens nicht angibst, verwendet das Modell standardmäßig 2.048 Token. Diese Grenze gewährleistet eine stabile Leistung auch bei der Verarbeitung großer Eingaben.
Code-Leistung
Unzensierte Modelle sind besonders wertvoll für Coding-Aufgaben, da sie weniger wahrscheinlich Anfragen ablehnen, die von Standardfiltern als 'unsicher' eingestuft werden. Zum Beispiel könnte ein Standardmodell die Generierung eines SQL-Injection-Payloads für Sicherheitsforschung verweigern, während ein abliteriertes Modell es direkt bereitstellt. Dies macht sie ideal für Entwickler, die rohe, ungefilterte Ausgaben für Analyse, Debugging oder kreatives Coding benötigen.
Das Modell unterstützt Function Calling, wodurch du Tools definieren und das Modell strukturierte JSON-Antworten zurückgeben lassen kannst. Dies ist entscheidend für den Aufbau von KI-Agenten, die mit externen APIs oder Datenbanken interagieren können. Du kannst auch den JSON-Modus erzwingen, um sicherzustellen, dass die Ausgabe des Modells immer gültiges JSON ist, was das Parsing in deiner Anwendung vereinfacht.
Bei der Integration der API kannst du die offiziellen OpenAI-SDKs oder jeden OpenAI-kompatiblen Client verwenden. Die Base URL ist https://api.abliterated.cc/v1, und du sendest Anfragen an den Endpunkt /v1/chat/completions. Die Modell-ID ist einfach uncensored.
Tool-Nutzung & Function Calling
Function Calling ist ein entscheidendes Feature für den Bau praktischer KI-Anwendungen. Unsere API unterstützt dies nativ, sodass du ein Schema von Tools definieren und das Modell entscheiden lassen kannst, welches Tool mit welchen Argumenten aufgerufen werden soll. Das Modell gibt eine strukturierte Antwort zurück, die du in deinem Code analysieren und ausführen kannst.
Du kannst den Parameter tool_choice angeben, um das Modell zu zwingen, ein bestimmtes Tool aufzurufen oder automatisch zu wählen. Diese Flexibilität ist nützlich für die Erstellung von Agenten, die mehrere Aktionen ausführen können, wie das Durchsuchen einer Datenbank, das Aktualisieren eines Benutzerprofils oder das Senden einer E-Mail.
- Strukturierte Ausgabe: Verwende
response_formatmit dem Wertjson_object, um gültiges JSON zu gewährleisten. - Tool-Definitionen: Definiere Tools im
tools-Array mit Name, Beschreibung und Parametern. - Ausführung: Analysiere die Antwort des Modells und führe die entsprechende Funktion in deinem Code aus.
Die API unterstützt Parameter wie temperature, top_p, stop, seed, presence_penalty und frequency_penalty, um das Verhalten des Modells fein abzustimmen. Dies ermöglicht es dir, Kreativität und Präzision je nach Anwendungsfall auszubalancieren.
Streaming-Effizienz
Streaming ist entscheidend für eine gute Benutzererfahrung in Chat-Anwendungen. Unsere API unterstützt Server-Sent Events (SSE), sodass du die Antwort des Modells Token für Token in Echtzeit empfangen kannst. Dies verringert die wahrgenommene Latenz für den Benutzer, da er die Antwort schrittweise erscheinen sieht, anstatt auf die vollständige Generierung warten zu müssen.
Bei Streaming enthält die API die Token-Nutzungsinformationen im letzten Chunk. So kannst du deinen Token-Verbrauch in Echtzeit verfolgen und den Stream stoppen, wenn du deine Budgetgrenzen erreichst. Die Streaming-Schnittstelle ist mit allen gängigen OpenAI SDKs kompatibel, was die Integration in bestehende Anwendungen erleichtert.
Eine zu berücksichtigende Abwägung ist, dass Streaming manchmal zu leicht höheren Token-Anzahlen im Vergleich zu Nicht-Streaming-Anfragen führen kann, da das Modell Füllwörter generieren oder zögern kann. Der Vorteil des sofortigen Feedbacks wiegt diese geringfügigen Kosten jedoch meist auf. Du kannst auch den Parameter stop verwenden, um die Generierung frühzeitig zu stoppen, wenn das Modell beginnt, sich zu wiederholen oder vom Thema abzuweichen.
Datenschutz & Training
Für viele Entwickler ist der Datenschutz ein wichtiges Anliegen. Wenn du unsere API nutzt, werden deine Prompts nicht zum Training verwendet. Das bedeutet, dass die Daten, die du an das Modell sendest, privat bleiben und nicht zur Verbesserung des Basismodells verwendet oder mit Dritten geteilt werden. Dies ist ein signifikanter Vorteil gegenüber einigen großen Anbietern, die Kundendaten zum Training nutzen.
Für die Anmeldung benötigst du nur eine E-Mail-Adresse. Du kannst dich mit Google anmelden oder eine E-Mail und ein Passwort verwenden. Es wird keine Telefonnummer benötigt, und für das Testguthaben ist keine Kreditkarte erforderlich. Das Testguthaben umfasst $0,50, die 7 Tage lang gültig sind, sodass du die API testen kannst, bevor du dich für einen kostenpflichtigen Plan entscheidest.
Es gibt eine harte Inhaltsgrenze, die immer gilt: Das Modell wird Anfragen verweigern, die sexuelle Inhalte mit Minderjährigen beinhalten. Alle anderen rechtlichen, kontroversen oder Nischen-Themen sind erlaubt. Dies stellt sicher, dass das Modell für eine breite Palette von Anwendungen nutzbar bleibt, ohne unerwartete Einschränkungen.
Warum eine API statt lokal?
Die lokale Ausführung eines Modells gibt dir die volle Kontrolle über Daten und Infrastruktur, erfordert jedoch erhebliche Hardware und technisches Know-how. Du musst GPU-Treiber, Speicherzuweisung und Modell-Updates verwalten. Für viele Entwickler, insbesondere diejenigen, die Prototypen oder kleine Anwendungen entwickeln, ist dieser Aufwand nicht gerechtfertigt.
Unsere API bietet eine gehostete Lösung, die die gesamte Infrastruktur verwaltet. Du erhältst einen zuverlässigen, skalierbaren Endpunkt mit vorhersehbaren Preisen. Die API unterstützt 300 Anfragen pro Minute und bis zu 8 parallele Anfragen pro Schlüssel, was für die meisten kleinen bis mittelgroßen Anwendungen ausreicht. Wenn du höhere Grenzen benötigst, kannst du den Support kontaktieren.
Ein weiterer Vorteil ist die einfache Integration. Du kannst denselben Code verwenden, den du auch für GPT-4 nutzen würdest, indem du nur die Basis-URL und den API-Schlüssel änderst. Dies reduziert die Lernkurve und ermöglicht es dir, bei Bedarf zwischen Modellen zu wechseln. Die API ist nicht an einen bestimmten Anbieter gebunden, sodass du nicht in einem einzelnen Ökosystem gefangen bist.
Erste Schritte mit Abliterated
Der Einstieg in unsere API ist einfach. Melde dich zunächst mit deiner E-Mail oder Google für ein Konto an. Du erhältst sofort einen API-Schlüssel, den du zur Authentifizierung deiner Anfragen verwenden kannst. Du kannst auch das Testguthaben nutzen, um die API zu testen, ohne Zahlungsdaten eingeben zu müssen.
Um deine erste Anfrage zu senden, verwende die POST-Methode am /v1/chat/completions-Endpunkt. Setze den model-Parameter auf uncensored und füge deinen Prompt in das messages-Array ein. Du kannst auch Parameter wie temperature und max_tokens angeben, um die Ausgabe zu steuern.
Fragen und Antworten
Ist dieses Modell auf Llama oder Mistral basiert?
Nein. Das Modell ist eine unabhängige Open-Weight-Architektur. Es ist kein GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama oder ein Modell eines anderen Anbieters. Es ist ein einzigartiges Modell, das für unzensiertes Verhalten optimiert ist.
Kann ich die API mit den offiziellen OpenAI SDKs verwenden?
Ja. Die API ist vollständig OpenAI-kompatibel. Du kannst die offiziellen OpenAI SDKs oder jeden Client verwenden, der das OpenAI-API-Format unterstützt, indem du die Basis-URL auf https://api.abliterated.cc/v1 setzt und deinen API-Schlüssel angibst.
Wie bezahle ich für die API?
Wir akzeptieren nur Kryptowährungen: USDT im TRC20-Netzwerk oder USDC im Base-Netzwerk. Du kannst dein Konto mit jedem beliebigen ganzzahligen Betrag zwischen $10 und $500 aufladen. Es gibt keine monatlichen Abonnements oder Kreditkartengebühren.
Wie groß ist das Kontextfenster?
Das Kontextfenster umfasst 100.000 Token, sowohl den Eingabe-Prompt als auch die Ausgabe-Vervollständigung. Die maximale Ausgabe pro Anfrage beträgt 32.000 Token bzw. 2.048 Token, wenn du keinen max_tokens-Parameter angibst.
Dein Schlüssel ist nur ein Formular entfernt
Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist die gesamte Einrichtung.