ID ▾
Dapatkan kunci API

Abliterated Models: Biaya, Konteks, dan Kode

Model Abliterated adalah model bahasa besar di mana mekanisme penegakan penolakan keamanan telah dihapus, memungkinkan model menjawab pertanyaan kontroversial, dewasa, atau niche tanpa terkena filter konten. Pendekatan ini memberikan pengembang kontrol penuh atas suara model dan batas pengetahuan, yang sangat berharga untuk pemrograman, permainan peran, dan penulisan kreatif di mana pagar pembatas standar mungkin memblokir output yang berguna.

Poin utama

  • Model Abliterated menggunakan satu file bobot di mana perilaku penolakan dihilangkan, bukan mengandalkan API moderasi eksternal.
  • API yang di-host kami menyediakan jendela konteks 100.000 token dan endpoint yang kompatibel dengan OpenAI untuk integrasi yang mulus.
  • Harga secara ketat dibayar per penggunaan dengan saldo kripto prabayar, sehingga Anda hanya membayar token yang benar-benar dikonsumsi.
  • Model ini adalah arsitektur bobot terbuka independen, bukan versi yang dikemas ulang dari Llama, Mistral, atau model vendor lain.

Apa Itu Model Abliterated?

Model Abliterated dibuat dengan mengambil model bahasa bobot terbuka yang ada dan secara sistematis menghapus atau meredam jalur saraf yang menyebabkan model menolak jenis konten tertentu. Tidak seperti model standar yang mungkin dengan sopan menolak untuk membahas topik karena kebijakan keamanan, model abliterated akan menjawab pertanyaan secara langsung. Prosesnya biasanya melibatkan identifikasi 'kepala perhatian' yang bertanggung jawab atas penolakan dan mengatur pengaruhnya menjadi hampir nol, atau menyesuaikan model pada dataset yang mendorong jawaban komprehensif.

Hasilnya adalah model yang mempertahankan kecerdasan dasar dan kemampuan penalaran tetapi tidak memiliki lapisan 'filtering'. Ini berarti model dapat membahas tema dewasa, opini kontroversial, atau topik teknis niche tanpa menghasilkan pesan penolakan. Penting untuk dicatat bahwa 'tanpa sensor' tidak berarti 'tidak cerdas'; model masih mengikuti instruksi dan menjaga koherensi. Namun, model juga dapat mencerminkan bias atau kesalahan yang ada dalam data pelatihan dasar tanpa polesan korporat biasa.

  • Integritas Model Dasar: Penalaran inti dan kemampuan bahasa tetap utuh.
  • Penghapusan Penolakan: Mekanisme spesifik yang memicu filter konten diredam.
  • File Bobot Tunggal: Seluruh model, termasuk keadaan abliterated, terkandung dalam satu file.

Biaya Inferensi Tanpa Sensor

Menjalankan model tanpa sensor secara lokal memerlukan perangkat keras yang signifikan, biasanya GPU dengan setidaknya 24GB VRAM untuk model berukuran menengah. Bagi pengembang yang membutuhkan keandalan dan skala, meng-host model sendiri memperkenalkan overhead operasional. API kami menawarkan model harga prediktif, bayar-per-penggunaan yang menghilangkan kebutuhan untuk manajemen GPU.

Kami mengenakan biaya $0,25 per 1 juta token input dan $1,00 per 1 juta token output. Tidak ada langganan bulanan atau biaya tersembunyi. Anda mengisi saldo prabayar menggunakan mata uang kripto (USDT di jaringan TRC20 atau USDC di jaringan Base), dan saldo tidak pernah kedaluwarsa. Kesalahan dalam permintaan Anda gratis, jadi Anda hanya membayar untuk penggunaan aktual. Model ini ideal untuk startup atau pengembang independen yang ingin menguji model tanpa berkomitmen pada biaya bulanan tetap.

Jenis PenggunaanBiaya per 1M Token
Token Input$0.25
Token Output$1.00

Anda dapat mengisi saldo akun Anda dengan jumlah bulat apa pun antara $10 dan $500. Jika Anda menambahkan $50 atau lebih, Anda menerima bonus 5% dalam kredit; menambahkan $100 atau lebih memberikan bonus 10%. Struktur ini memastikan bahwa biaya infrastruktur Anda berkembang secara linier dengan lalu lintas aplikasi Anda.

Keuntungan Jendela Konteks

Salah satu faktor paling kritis bagi pengembang yang bekerja dengan dokumen panjang, basis kode, atau percakapan kompleks adalah jendela konteks. API kami menyediakan jendela konteks 100.000 token, yang memungkinkan model memproses dan menyimpan sejumlah besar informasi dalam satu permintaan. Ini jauh lebih besar daripada batas 8.000 token standar yang ditemukan di banyak model lama atau lebih kecil.

Jendela konteks 100k memungkinkan beberapa kasus penggunaan lanjutan. Anda dapat meneruskan seluruh repositori kode sebagai konteks, memungkinkan model memahami ketergantungan lintas-file. Anda juga dapat mempertahankan percakapan panjang dan koheren tanpa model melupakan instruksi sebelumnya. Jendela konteks mencakup baik prompt input maupun kelengkapan output, jadi Anda perlu merencanakan anggaran token Anda dengan hati-hati.

  • Analisis Kode: Teruskan beberapa file untuk mendapatkan saran yang sadar konteks.
  • Percakapan Panjang: Jaga status selama beberapa giliran tanpa kehilangan topik.
  • Ringkasan Dokumen: Proses blok teks besar dalam satu panggilan.

Perhatikan bahwa output maksimum per permintaan adalah 32.000 token. Jika Anda tidak menentukan parameter max_tokens, model akan menggunakan nilai default 2.048 token. Batas ini memastikan kinerja stabil bahkan saat memproses input besar.

Kinerja Pemrograman

Model tanpa sensor sangat berharga untuk tugas pemrograman karena lebih kecil kemungkinannya untuk menolak permintaan yang mungkin dianggap 'tidak aman' oleh filter standar. Misalnya, model standar mungkin menolak untuk menghasilkan payload injeksi SQL untuk penelitian keamanan, sementara model abliterated akan memberikannya secara langsung. Ini membuatnya ideal untuk pengembang yang membutuhkan output mentah, tidak tersaring untuk analisis, debugging, atau pemrograman kreatif.

Model mendukung pemanggilan fungsi, yang memungkinkan Anda menentukan alat dan memiliki model mengembalikan respons JSON terstruktur. Ini penting untuk membangun agen AI yang dapat berinteraksi dengan API atau basis data eksternal. Anda juga dapat memaksakan mode JSON untuk memastikan output model selalu JSON valid, yang menyederhanakan parsing di aplikasi Anda.

Saat mengintegrasikan API, Anda dapat menggunakan SDK OpenAI resmi atau klien kompatibel OpenAI apa pun. URL dasar adalah https://api.abliterated.cc/v1, dan Anda mengirim permintaan ke endpoint /v1/chat/completions. ID modelnya hanyalah uncensored.

Penggunaan Alat & Pemanggilan Fungsi

Pemanggilan fungsi adalah fitur penting untuk membangun aplikasi AI yang praktis. API kami mendukung fitur ini secara native, memungkinkan Anda menentukan skema alat dan membiarkan model memutuskan alat mana yang akan dipanggil serta dengan argumen apa. Model mengembalikan respons terstruktur yang dapat Anda uraikan dan eksekusi dalam kode Anda.

Anda dapat menentukan parameter tool_choice untuk memaksa model memanggil alat tertentu atau memilih secara otomatis. Fleksibilitas ini berguna untuk membuat agen yang dapat melakukan beberapa tindakan, seperti mencari basis data, memperbarui profil pengguna, atau mengirim email.

  • Output Terstruktur: Gunakan response_format diatur ke json_object untuk memastikan JSON valid.
  • Definisi Alat: Tentukan alat dalam array tools dengan nama, deskripsi, dan parameter.
  • Eksekusi: Uraikan respons model dan eksekusi fungsi yang sesuai dalam kode Anda.

API mendukung parameter seperti temperature, top_p, stop, seed, presence_penalty, dan frequency_penalty untuk menyesuaikan perilaku model. Ini memungkinkan Anda menyeimbangkan kreativitas dan presisi tergantung pada kasus penggunaan Anda.

Efisiensi Streaming

Streaming sangat penting untuk memberikan pengalaman pengguna yang baik dalam aplikasi obrolan. API kami mendukung Server-Sent Events (SSE), memungkinkan Anda menerima respons model token demi token secara real time. Hal ini mengurangi latensi yang dirasakan pengguna, karena mereka melihat respons muncul secara bertahap daripada menunggu seluruh respons dihasilkan.

Saat streaming, API menyertakan informasi penggunaan token dalam potongan terakhir. Ini memungkinkan Anda melacak konsumsi token Anda secara real time dan menghentikan aliran jika Anda mendekati batas anggaran Anda. Antarmuka streaming kompatibel dengan semua SDK OpenAI standar, sehingga mudah diintegrasikan ke dalam aplikasi yang ada.

Salah satu pertukaran yang perlu dipertimbangkan adalah bahwa streaming terkadang dapat menghasilkan jumlah token yang sedikit lebih tinggi dibandingkan permintaan non-streaming, karena model mungkin menghasilkan kata-kata pengisi atau ragu-ragu. Namun, manfaat umpan balik segera sering kali melebihi biaya minor ini. Anda juga dapat menggunakan parameter stop untuk menghentikan generasi lebih awal jika model mulai mengulang diri atau menyimpang dari topik.

Privasi Data & Pelatihan

Bagi banyak pengembang, privasi data adalah kekhawatiran utama. Saat Anda menggunakan API kami, prompt Anda tidak digunakan untuk pelatihan. Ini berarti data yang Anda kirimkan ke model tetap privat dan tidak digunakan untuk meningkatkan model dasar atau dibagikan dengan pihak ketiga. Ini adalah keuntungan signifikan dibandingkan beberapa vendor besar yang menggunakan data pelanggan untuk pelatihan.

Untuk mendaftar, Anda hanya memerlukan alamat email. Anda dapat masuk dengan Google atau menggunakan email dan kata sandi. Tidak diperlukan nomor telepon, dan tidak diperlukan kartu kredit untuk uji coba. Uji coba mencakup $0.50 kredit yang berlaku selama 7 hari, memungkinkan Anda menguji API sebelum berkomitmen pada paket berbayar.

Ada satu batas konten keras yang selalu berlaku: model akan menolak permintaan yang melibatkan konten seksual dengan anak di bawah umur. Semua topik dewasa, kontroversial, atau niche lainnya yang sah diperbolehkan. Ini memastikan bahwa model tetap dapat digunakan untuk berbagai aplikasi tanpa batasan yang tidak terduga.

Mengapa Memilih API Dibandingkan Lokal?

Menjalankan model secara lokal memberi Anda kontrol penuh atas data dan infrastruktur, tetapi memerlukan perangkat keras dan keahlian teknis yang signifikan. Anda perlu mengelola driver GPU, alokasi memori, dan pembaruan model. Bagi banyak pengembang, terutama mereka yang membangun prototipe atau aplikasi skala kecil, overhead ini tidak sebanding.

API kami menyediakan solusi terhosting yang menangani semua infrastruktur. Anda mendapatkan endpoint yang andal dan dapat diskalakan dengan harga yang dapat diprediksi. API mendukung 300 permintaan per menit dan hingga 8 permintaan konkuren per kunci, yang cukup untuk sebagian besar aplikasi skala kecil hingga menengah. Jika Anda membutuhkan batas yang lebih tinggi, Anda dapat menghubungi dukungan.

Keuntungan lain adalah kemudahan integrasi. Anda dapat menggunakan kode yang sama yang akan Anda gunakan untuk GPT-4, hanya dengan mengubah URL dasar dan kunci API. Ini mengurangi kurva pembelajaran dan memungkinkan Anda beralih di antara model jika diperlukan. API tidak terikat pada vendor tertentu, jadi Anda tidak terkunci dalam satu ekosistem.

Memulai dengan Abliterated

Memulai dengan API kami sangat mudah. Pertama, daftar akun menggunakan email atau Google Anda. Anda akan menerima kunci API segera, yang dapat Anda gunakan untuk mengotentikasi permintaan Anda. Anda juga dapat menggunakan kredit uji coba gratis untuk menguji API tanpa memasukkan informasi pembayaran.

Untuk membuat permintaan pertama Anda, gunakan metode POST pada endpoint /v1/chat/completions. Atur parameter model menjadi uncensored dan sertakan prompt Anda dalam array messages. Anda juga dapat menentukan parameter seperti temperature dan max_tokens untuk mengontrol output.

Tanya jawab

Apakah model ini didasarkan pada Llama atau Mistral?

Tidak. Model ini adalah arsitektur bobot terbuka independen. Ini bukan GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama, atau model vendor lainnya. Ini adalah model unik yang disesuaikan untuk perilaku tanpa sensor.

Dapatkah saya menggunakan API dengan SDK OpenAI resmi?

Ya. API sepenuhnya kompatibel dengan OpenAI. Anda dapat menggunakan SDK OpenAI resmi atau klien apa pun yang mendukung format API OpenAI dengan mengatur URL dasar ke https://api.abliterated.cc/v1 dan menyediakan kunci API Anda.

Bagaimana cara membayar untuk API?

Kami hanya menerima mata uang kripto: USDT di jaringan TRC20 atau USDC di jaringan Base. Anda dapat mengisi saldo dengan jumlah bulat apa pun antara $10 dan $500. Tidak ada langganan bulanan atau biaya kartu kredit.

Berapa ukuran jendela konteks?

Jendela konteks adalah 100.000 token, yang mencakup baik prompt input maupun hasil output. Output maksimum per permintaan adalah 32.000 token, atau 2.048 token jika Anda tidak menentukan parameter max_tokens.

Kunci Anda hanya selangkah lagi dari satu formulir

Buat akun, salin kuncinya, ubah URL dasar. Itu saja seluruh pengaturannya.