PL ▾
Pobierz klucz API

Abliterated: Koszt, Kontekst i Kod

Modele Abliterated to duże modele językowe, w których usunięto mechanizmy wymuszające odmowę odpowiedzi, co pozwala modelowi odpowiadać na pytania kontrowersyjne, dla dorosłych lub wąskiej tematyki bez trafienia w filtr treści. Podejście to daje programistom pełną kontrolę nad głosem modelu i zakresem wiedzy, co jest szczególnie cenne w kodowaniu, roleplay i pisaniu kreatywnym, gdzie standardowe ograniczenia mogą blokować przydatne wyjście.

Kluczowe punkty

  • Modele Abliterated używają pojedynczego pliku wag, w którym zachowania odmowne są wygaszone, zamiast polegać na zewnętrznych API moderacji.
  • Nasze hostowane API zapewnia okno kontekstu o rozmiarze 100 000 tokenów i endpointy kompatybilne z OpenAI dla bezproblemowej integracji.
  • Cennik opiera się ściśle na modelu pay-per-use z przedpłaconym kredytem krypto, więc płacisz tylko za faktycznie zużyte tokeny.
  • Model to niezależna architektura o otwartych wagach, a nie przepakowana wersja modeli Llama, Mistral lub innych dostawców.

Czym są modele Abliterated?

Modele Abliterated powstają poprzez pobranie istniejącego modelu językowego o otwartych wagach i systematyczne usunięcie lub osłabienie dróg neuronowych, które powodują odmowę odpowiedzi na pewne typy treści. W przeciwieństwie do standardowych modeli, które mogą grzecznie odmówić omówienia tematu ze względu na politykę bezpieczeństwa, model abliterated odpowie na pytanie bezpośrednio. Proces ten obejmuje zazwyczaj zidentyfikowanie 'głowic uwagi' odpowiedzialnych za odmowę i ustawienie ich wpływu na poziom bliski zeru, lub dostrajanie modelu na zbiorze danych, który zachęca do kompleksowych odpowiedzi.

Efektem jest model, który zachowuje swoją bazową inteligencję i zdolności rozumowania, ale nie ma warstwy 'filtrującej'. Oznacza to, że może omawiać tematy erotyczne, kontrowersyjne opinie lub niszowe tematy techniczne bez generowania komunikatu odmowy. Warto zauważyć, że 'bez cenzury' nie oznacza 'bez inteligencji'; model nadal wykonuje instrukcje i zachowuje spójność. Może jednak odzwierciedlać uprzedzenia lub błędy obecne w danych treningowych bazowych bez typowego korporacyjnego wygładzenia.

  • Integralność modelu bazowego: Podstawowe zdolności rozumowania i językowe pozostają nienaruszone.
  • Usunięcie odmowy: Specyficzne mechanizmy wyzwalające filtry treści są osłabione.
  • Pojedynczy plik wag: Cały model, w tym stan abliterowany, znajduje się w jednym pliku.

Koszt wnioskowania bez cenzury

Uruchomienie modelu bez cenzury lokalnie wymaga znacznego sprzętu, zazwyczaj GPU z co najmniej 24 GB VRAM dla modeli średniej wielkości. Dla programistów potrzebujących niezawodności i skalowalności, hostowanie modelu we własnym zakresie wprowadza nakład operacyjny. Nasze API oferuje przewidywalny model wyceny pay-per-use, który eliminuje potrzebę zarządzania GPU.

Obliczamy $0,25 za 1 milion tokenów wejściowych i $1,00 za 1 milion tokenów wyjściowych. Nie ma miesięcznych subskrypcji ani ukrytych opłat. Doładowujesz kredyt za pomocą kryptowalut (USDT w sieci TRC20 lub USDC na Base), a kredyt nigdy nie wygasa. Błędy w Twoich zapytaniach są darmowe, więc płacisz tylko za rzeczywiste użycie. Model ten jest idealny dla startupów lub niezależnych deweloperów, którzy chcą przetestować model bez zobowiązania się do stałego miesięcznego kosztu.

Typ użyciaKoszt za 1M tokenów
Tokeny wejściowe$0.25
Tokeny wyjściowe$1.00

Możesz doładować swoje konto dowolną kwotą całkowitą między $10 a $500. Jeśli dodasz $50 lub więcej, otrzymasz 5% bonusu w kredycie; dodanie $100 lub więcej daje 10% bonusu. Ta struktura zapewnia, że koszty infrastruktury skalują się liniowo z ruchem Twojej aplikacji.

Zalety okna kontekstu

Jednym z najważniejszych czynników dla deweloperów pracujących z długimi dokumentami, bazami kodu lub złożonymi rozmowami jest okno kontekstu. Nasze API zapewnia okno kontekstu o rozmiarze 100 000 tokenów, które pozwala modelowi przetwarzać i zachować dużą ilość informacji w ramach jednego zapytania. Jest to znacznie więcej niż standardowe limity 8 000 tokenów występujące w wielu starszych lub mniejszych modelach.

Okno kontekstu 100k umożliwia kilka zaawansowanych przypadków użycia. Możesz przekazać całe repozytorium kodu jako kontekst, pozwalając modelowi zrozumieć zależności między plikami. Możesz również prowadzić długie, spójne rozmowy bez zapominania przez model wcześniejszych instrukcji. Okno kontekstu obejmuje zarówno prompt wejściowy, jak i uzupełnienie wyjściowe, więc musisz starannie zaplanować swój budżet tokenów.

  • Analiza kodu: Przekaż wiele plików, aby uzyskać sugestie uwzględniające kontekst.
  • Długie rozmowy: Zachowaj stan przez wiele tur, nie tracąc wątku.
  • Podsumowanie dokumentów: Przetwarzaj duże bloki tekstu w jednym wywołaniu.

Pamiętaj, że maksymalna długość odpowiedzi na jedno zapytanie to 32 000 tokenów. Jeśli nie określisz parametru max_tokens, model przyjmie wartość domyślną 2 048 tokenów. Limit ten zapewnia stabilną wydajność nawet przy przetwarzaniu dużych danych wejściowych.

Wydajność kodowania

Modele bez cenzury są szczególnie cenne w zadaniach programistycznych, ponieważ rzadziej odmawiają odpowiedzi na żądania, które mogą zostać uznane za 'niebezpieczne' przez standardowe filtry. Na przykład standardowy model może odmówić wygenerowania payloadu SQL injection do celów badawczych, podczas gdy model abliterowany poda go wprost. Dzięki temu są idealne dla programistów potrzebujących surowych, niefiltrowanych danych do analizy, debugowania lub kreatywnego kodowania.

Model obsługuje wywoływanie funkcji, co pozwala zdefiniować narzędzia i uzyskać od modelu strukturalne odpowiedzi JSON. Jest to kluczowe dla budowania agentów AI, które mogą interagować z zewnętrznymi API lub bazami danych. Możesz również wymusić tryb JSON, aby zapewnić, że wyjście modelu jest zawsze poprawnym JSON, co upraszcza parsowanie w Twojej aplikacji.

Podczas integracji API możesz użyć oficjalnych SDK OpenAI lub dowolnego klienta zgodnego z OpenAI. Podstawowy adres URL to https://api.abliterated.cc/v1, a zapytania wysyłasz do endpointu /v1/chat/completions. ID modelu to po prostu uncensored.

Używanie narzędzi i wywoływanie funkcji

Wywoływanie funkcji to kluczowa funkcja przy budowaniu praktycznych aplikacji AI. Nasze API obsługuje to natywnie, pozwalając zdefiniować schemat narzędzi i pozwolić modelowi zdecydować, które narzędzie wywołać i z jakimi argumentami. Model zwraca strukturalną odpowiedź, którą możesz sparsować i wykonać w swoim kodzie.

Możesz określić parametr tool_choice, aby wymusić wywołanie przez model konkretnej funkcji lub pozwolić mu na wybór automatyczny. Ta elastyczność jest przydatna przy tworzeniu agentów, którzy mogą wykonywać wiele akcji, takich jak wyszukiwanie w bazie danych, aktualizacja profilu użytkownika lub wysłanie e-maila.

  • Wyjście strukturalne: Użyj response_format ustawionego na json_object, aby zapewnić poprawny JSON.
  • Definicje narzędzi: Zdefiniuj narzędzia w tablicy tools z nazwą, opisem i parametrami.
  • Wykonanie: Sparsuj odpowiedź modelu i wykonaj odpowiednią funkcję w swoim kodzie.

API obsługuje parametry takie jak temperature, top_p, stop, seed, presence_penalty oraz frequency_penalty, aby dostrajać zachowanie modelu. Pozwala to na balansowanie między kreatywnością a precyzją w zależności od przypadku użycia.

Wydajność strumieniowania

Strumieniowanie jest kluczowe dla zapewnienia dobrej jakości doświadczenia użytkownika w aplikacjach czatowych. Nasze API obsługuje zdarzenia wysłane przez serwer (SSE), co pozwala na odbieranie odpowiedzi modelu token po tokenie w czasie rzeczywistym. Zmniejsza to postrzeganą opóźnienie dla użytkownika, ponieważ widzi on powoli pojawiającą się odpowiedź, zamiast czekać na wygenerowanie całej treści.

Podczas strumieniowania API dołącza informacje o zużyciu tokenów w ostatnim czacie. Pozwala to na śledzenie zużycia tokenów w czasie rzeczywistym i zatrzymanie strumienia, jeśli zbliżysz się do limitów budżetu. Interfejs strumieniowania jest kompatybilny ze wszystkimi standardowymi SDK OpenAI, co ułatwia integrację z istniejącymi aplikacjami.

Jednym z kompromisów do rozważenia jest to, że strumieniowanie może czasami prowadzić do nieco wyższych liczb tokenów w porównaniu do zapytań bez strumieniowania, ponieważ model może generować słowa wypełniające lub zwlekać. Jednak korzyść z natychmiastowej informacji zwrotnej często przewyższa ten niewielki koszt. Możesz również użyć parametru stop, aby zatrzymać generowanie wcześniej, jeśli model zacznie się powtarzać lub odbiegać od tematu.

Prywatność danych i trenowanie

Dla wielu programistów prywatność danych jest najważniejszym problemem. Korzystając z naszego API, Twoje prompty nie są używane do trenowania. Oznacza to, że dane wysłane do modelu pozostają prywatne i nie są używane do ulepszania modelu bazowego ani udostępniane stronom trzecim. Jest to istotna przewaga nad niektórymi dużymi dostawcami, którzy wykorzystują dane klientów do trenowania.

Aby się zarejestrować, potrzebujesz tylko adresu e-mail. Możesz zalogować się przez Google lub użyć adresu e-mail i hasła. Nie jest wymagany numer telefonu, a do próby nie potrzebujesz karty kredytowej. Próba obejmuje kredyt w wysokości $0,50 ważny przez 7 dni, co pozwala przetestować API przed zobowiązaniem się do płatnego planu.

Istnieje jeden twardy limit treści, który zawsze obowiązuje: model odmówi zapytań dotyczących treści seksualnych z udziałem małoletnich. Wszystkie inne legalne tematy dla dorosłych, kontrowersyjne lub niszowe są dozwolone. Zapewnia to, że model pozostaje użyteczny dla szerokiego zakresu aplikacji bez nieoczekiwanych ograniczeń.

Dlaczego wybrać API zamiast lokalnego?

Uruchomienie modelu lokalnie daje Ci pełną kontrolę nad danymi i infrastrukturą, ale wymaga znaczących zasobów sprzętowych i wiedzy technicznej. Musisz zarządzać sterownikami GPU, alokacją pamięci i aktualizacjami modelu. Dla wielu programistów, zwłaszcza tych budujących prototypy lub aplikacje o małej skali, ten nakład pracy nie jest tego wart.

Nasze API dostarcza rozwiązanie hostowane, które obsługuje całą infrastrukturę. Otrzymujesz niezawodny, skalowalny endpoint z przewidywalnymi cenami. API obsługuje 300 zapytań na minutę i do 8 równoległych zapytań na klucz, co jest wystarczające dla większości małych i średnich aplikacji. Jeśli potrzebujesz wyższych limitów, możesz skontaktować się z pomocą techniczną.

Kolejną zaletą jest łatwość integracji. Możesz użyć tego samego kodu, którego użyłbyś dla GPT-4, zmieniając tylko podstawowy adres URL i klucz API. Zmniejsza to krzywą uczenia się i pozwala na przełączanie między modelami, jeśli zajdzie taka potrzeba. API nie jest powiązane z żadnym konkretnym dostawcą, więc nie jesteś zablokowany w jednym ekosystemie.

Pierwsze kroki z Abliterated

Pierwsze kroki z naszym API są proste. Najpierw zarejestruj konto, używając swojego adresu e-mail lub Google. Otrzymasz natychmiast klucz API, którego możesz użyć do uwierzytelniania swoich zapytań. Możesz również użyć kredytu próbnego do przetestowania API bez wprowadzania danych płatniczych.

Aby wysłać swoje pierwsze zapytanie, użyj metody POST na endpointzie /v1/chat/completions. Ustaw parametr model na uncensored i uwzględnij swój prompt w tablicy messages. Możesz również określić parametry takie jak temperature i max_tokens, aby kontrolować wynik.

Pytania i odpowiedzi

Czy ten model oparty jest na Llamie lub Mistral?

Nie. Model jest niezależną architekturą o otwartych wagach. Nie jest to GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama ani żaden inny model dostawcy. Jest to unikalny model dostrojony do zachowania bez cenzury.

Czy mogę użyć API z oficjalnymi SDK OpenAI?

Tak. API jest w pełni zgodne z OpenAI. Możesz użyć oficjalnych SDK OpenAI lub dowolnego klienta obsługującego format API OpenAI, ustawiając podstawowy adres URL na https://api.abliterated.cc/v1 i podając swój klucz API.

Jak płacić za API?

Akceptujemy tylko kryptowaluty: USDT w sieci TRC20 lub USDC w sieci Base. Możesz doładować dowolną kwotę całkowitą między $10 a $500. Nie ma miesięcznych subskrypcji ani opłat za karty kredytowe.

Jaki jest rozmiar okna kontekstu?

Okno kontekstu wynosi 100 000 tokenów, co obejmuje zarówno prompt wejściowy, jak i wynik generowany przez model. Maksymalna długość odpowiedzi na jedno zapytanie to 32 000 tokenów, lub 2 048 tokenów, jeśli nie określisz parametru max_tokens.

Twój klucz jest o jeden formularz stąd

Utwórz konto, skopiuj klucz, zmień adres URL bazowy. To cała konfiguracja.