Modelli Abliterated: Costi, Contesto e Codice
I modelli Abliterated sono modelli linguistici di grandi dimensioni in cui i meccanismi che impongono i rifiuti di sicurezza sono stati rimossi, consentendo al modello di rispondere a domande controverse, per adulti o di nicchia senza attivare un filtro sui contenuti. Questo approccio offre agli sviluppatori il controllo completo sulla voce e sul cutoff di conoscenza del modello, il che è particolarmente utile per il coding, il roleplay e la scrittura creativa dove i guardrail standard potrebbero bloccare output utili.
Aggiornato
Punti chiave
- I modelli Abliterated utilizzano un singolo file di pesi in cui i comportamenti di rifiuto sono disattivati, invece di fare affidamento su API di moderazione esterne.
- La nostra API ospitata fornisce una finestra di contesto da 100.000 token e endpoint compatibili con OpenAI per un'integrazione senza soluzione di continuità.
- I prezzi sono rigorosamente a consumo con credito cripto prepagato, quindi paghi solo per i token effettivamente consumati.
- Il modello è un'architettura open-weight indipendente, non una versione riciclata di Llama, Mistral o altri modelli di vendor.
Cosa sono i modelli Abliterated?
I modelli Abliterated vengono creati prendendo un modello linguistico open-weight esistente e rimuovendo o attenuando sistematicamente i percorsi neurali che causano il rifiuto di determinati tipi di contenuto. A differenza dei modelli standard che potrebbero rifiutare educatamente di discutere un argomento a causa di una policy di sicurezza, un modello abliterated risponderà alla domanda direttamente. Il processo comporta tipicamente l'identificazione dei 'testa di attenzione' responsabili del rifiuto e l'impostazione della loro influenza quasi a zero, o l'ottimizzazione del modello su un dataset che incoraggia risposte complete.
Il risultato è un modello che mantiene la sua intelligenza e capacità di ragionamento di base ma manca dello strato di 'filtraggio'. Questo significa che può discutere temi per adulti, opinioni controverse o argomenti tecnici di nicchia senza generare un messaggio di rifiuto. È importante notare che 'senza censura' non significa 'non intelligente'; il modello segue ancora le istruzioni e mantiene la coerenza. Tuttavia, può anche riflettere i bias o gli errori presenti nei dati di addestramento di base senza la solita levatura aziendale.
- Integrità del modello base: Le capacità di ragionamento e linguaggio di base rimangono intatte.
- Rimozione dei rifiuti: I meccanismi specifici che attivano i filtri sui contenuti sono attenuati.
- File di pesi singolo: L'intero modello, incluso lo stato abliterated, è contenuto in un unico file.
Il costo dell'inferenza senza censura
Eseguire un modello senza censura localmente richiede hardware significativo, tipicamente una GPU con almeno 24GB di VRAM per modelli di medie dimensioni. Per gli sviluppatori che hanno bisogno di affidabilità e scalabilità, ospitare il modello da soli introduce un overhead operativo. La nostra API offre un modello di prezzo prevedibile a consumo che elimina la necessità di gestire le GPU.
Addebitiamo $0,25 per 1 milione di token di input e $1,00 per 1 milione di token di output. Non ci sono abbonamenti mensili o costi nascosti. Carichi il credito usando criptovalute (USDT su TRC20 o USDC su Base) e il credito non scade mai. Gli errori nelle tue richieste sono gratuiti, quindi paghi solo per l'utilizzo effettivo. Questo modello è ideale per startup o sviluppatori indie che vogliono testare un modello senza impegnarsi in un costo mensile fisso.
| Tipo di utilizzo | Costo per 1M Token |
|---|---|
| Token di input | $0.25 |
| Token di output | $1.00 |
Puoi ricaricare il tuo account con qualsiasi importo intero tra $10 e $500. Se aggiungi $50 o più, ricevi un bonus del 5% in credito; aggiungere $100 o più garantisce un bonus del 10%. Questa struttura garantisce che i costi della tua infrastruttura scalino linearmente con il traffico della tua applicazione.
Vantaggi della finestra di contesto
Uno dei fattori più critici per gli sviluppatori che lavorano con documenti lunghi, codebase o conversazioni complesse è la finestra di contesto. La nostra API fornisce una finestra di contesto da 100.000 token, che consente al modello di elaborare e mantenere una grande quantità di informazioni all'interno di una singola richiesta. Questo è significativamente più grande dei limiti standard da 8.000 token trovati in molti modelli più vecchi o più piccoli.
Una finestra di contesto da 100k abilita diversi casi d'uso avanzati. Puoi passare un'intera repository di codice come contesto, consentendo al modello di comprendere le dipendenze tra file. Puoi anche mantenere conversazioni lunghe e coerenti senza che il modello dimentichi le istruzioni precedenti. La finestra di contesto include sia il prompt di input che il completamento di output, quindi devi pianificare attentamente il tuo budget di token.
- Analisi del codice: Passa più file per ottenere suggerimenti consapevoli del contesto.
- Conversazioni lunghe: Mantieni lo stato per decine di turni senza perdere il filo dell'argomento.
- Riassunto di documenti: Elaborare grandi blocchi di testo in una singola chiamata.
Tieni presente che il massimo output per richiesta è di 32.000 token. Se non specifichi il parametro max_tokens, il modello utilizzerà come default 2.048 token. Questo limite garantisce prestazioni stabili anche quando si elaborano input di grandi dimensioni.
Prestazioni di coding
I modelli senza censura sono particolarmente utili per le attività di coding perché è meno probabile che rifiutino richieste che potrebbero essere considerate 'insicure' dai filtri standard. Ad esempio, un modello standard potrebbe rifiutarsi di generare un payload di SQL injection per la ricerca di sicurezza, mentre un modello ablleted lo fornirà direttamente. Questo li rende ideali per gli sviluppatori che hanno bisogno di output grezzo e non filtrato per analisi, debugging o coding creativo.
Il modello supporta la chiamata di funzioni, che ti consente di definire strumenti e far sì che il modello restituisca risposte JSON strutturate. Questo è essenziale per costruire agenti AI che possono interagire con API o database esterni. Puoi anche imporre la modalità JSON per garantire che l'output del modello sia sempre JSON valido, semplificando l'analisi nel tuo'applicazione.
Quando integri l'API, puoi utilizzare gli SDK ufficiali di OpenAI o qualsiasi client compatibile con OpenAI. L'URL di base è https://api.abliterated.cc/v1 e invii richieste all'endpoint /v1/chat/completions. L'ID del modello è semplicemente uncensored.
Uso di strumenti e chiamata di funzioni
La chiamata di funzioni è una funzionalità critica per la creazione di applicazioni AI pratiche. La nostra API supporta questa funzionalità nativamente, consentendoti di definire uno schema di strumenti e far sì che il modello decida quale strumento chiamare e con quali argomenti. Il modello restituisce una risposta strutturata che puoi analizzare ed eseguire nel tuo codice.
Puoi specificare il parametro tool_choice per forzare il modello a chiamare uno strumento specifico o a scegliere automaticamente. Questa flessibilità è utile per creare agenti che possono eseguire più azioni, come cercare in un database, aggiornare un profilo utente o inviare un'email.
- Output strutturato: Usa
response_formatimpostato sujson_objectper garantire JSON valido. - Definizioni degli strumenti: Definisci gli strumenti nell'array
toolscon nome, descrizione e parametri. - Esecuzione: Analizza la risposta del modello ed esegui la funzione corrispondente nel tuo codice.
L'API supporta parametri come temperature, top_p, stop, seed, presence_penalty e frequency_penalty per ottimizzare il comportamento del modello. Questo ti consente di bilanciare creatività e precisione a seconda del tuo caso d'uso.
Efficienza dello streaming
Lo streaming è essenziale per offrire una buona esperienza utente nelle applicazioni di chat. La nostra API supporta gli eventi Server-Sent (SSE), consentendoti di ricevere la risposta del modello token per token in tempo reale. Questo riduce la latenza percepita dall'utente, che vede la risposta apparire gradualmente invece di attendere che l'intera risposta venga generata.
Durante lo streaming, l'API include le informazioni sull'utilizzo dei token nell'ultimo blocco. Questo ti permette di monitorare il consumo di token in tempo reale e interrompere lo streaming se ti avvicini ai limiti del tuo budget. L'interfaccia di streaming è compatibile con tutti gli SDK standard di OpenAI, rendendo semplice l'integrazione nelle applicazioni esistenti.
Un compromesso da considerare è che lo streaming può talvolta risultare in un conteggio di token leggermente superiore rispetto alle richieste non in streaming, poiché il modello potrebbe generare parole di riempimento o esitare. Tuttavia, il vantaggio del feedback immediato spesso supera questo lieve costo. Puoi anche utilizzare il parametro stop per interrompere la generazione anticipatamente se il modello inizia a ripetersi o a divagare.
Privacy dei dati e addestramento
Per molti sviluppatori, la privacy dei dati è una preoccupazione primaria. Quando utilizzi la nostra API, i tuoi prompt non vengono utilizzati per l'addestramento. Ciò significa che i dati che invii al modello rimangono privati e non vengono utilizzati per migliorare il modello di base né condivisi con terze parti. Questo è un vantaggio significativo rispetto ad alcuni grandi fornitori che utilizzano i dati dei clienti per l'addestramento.
Per iscriverti, ti serve solo un indirizzo email. Puoi accedere con Google o utilizzando email e password. Non è richiesto il numero di telefono e non è necessaria una carta di credito per la prova. La prova include $0,50 di credito valido per 7 giorni, permettendoti di testare l'API prima di passare a un piano a pagamento.
Esiste un unico limite di contenuto rigido che si applica sempre: il modello rifiuterà le richieste che coinvolgono contenuti sessuali con i minori. Tutti gli altri argomenti legali per adulti, controversi o di nicchia sono consentiti. Questo garantisce che il modello rimanga utilizzabile per un'ampia gamma di applicazioni senza restrizioni impreviste.
Perché scegliere un'API rispetto a una soluzione locale?
Eseguire un modello localmente ti dà il pieno controllo sui dati e sull'infrastruttura, ma richiede hardware significativo e competenze tecniche. Devi gestire i driver GPU, l'allocazione della memoria e gli aggiornamenti del modello. Per molti sviluppatori, specialmente quelli che costruiscono prototipi o applicazioni su piccola scala, questo overhead non ne vale la pena.
La nostra API fornisce una soluzione ospitata che gestisce tutta l'infrastruttura. Ottieni un endpoint affidabile e scalabile con prezzi prevedibili. L'API supporta 300 richieste al minuto e fino a 8 richieste parallele per chiave, il che è sufficiente per la maggior parte delle applicazioni di piccole e medie dimensioni. Se hai bisogno di limiti superiori, puoi contattare il supporto.
Un altro vantaggio è la facilità di integrazione. Puoi utilizzare lo stesso codice che useresti per GPT-4, semplicemente cambiando l'URL di base e la chiave API. Questo riduce la curva di apprendimento e ti permette di passare tra i modelli se necessario. L'API non è vincolata a un fornitore specifico, quindi non sei bloccato in un singolo ecosistema.
Iniziare con Abliterated
Iniziare con la nostra API è semplice. Prima di tutto, iscriviti a un account utilizzando la tua email o Google. Riceverai immediatamente una chiave API, che puoi utilizzare per autenticare le tue richieste. Puoi anche utilizzare il credito di prova per testare l'API senza inserire le informazioni di pagamento.
Per effettuare la tua prima richiesta, utilizza il metodo POST sull'endpoint /v1/chat/completions. Imposta il parametro model su uncensored e includi il tuo prompt nell'array messages. Puoi anche specificare parametri come temperature e max_tokens per controllare l'output.
Domande e risposte
Questo modello è basato su Llama o Mistral?
No. Il modello è un'architettura open-weight indipendente. Non è GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama o il modello di nessun altro fornitore. È un modello unico ottimizzato per un comportamento senza censura.
Posso usare l'API con gli SDK ufficiali di OpenAI?
Sì. L'API è completamente compatibile con OpenAI. Puoi utilizzare gli SDK ufficiali di OpenAI o qualsiasi client che supporti il formato API OpenAI impostando l'URL di base su https://api.abliterated.cc/v1 e fornendo la tua chiave API.
Come pago per l'API?
Accettiamo solo criptovalute: USDT sulla rete TRC20 o USDC sulla rete Base. Puoi ricaricare con qualsiasi importo intero tra $10 e $500. Non ci sono abbonamenti mensili o addebiti sulla carta di credito.
Qual è la dimensione della finestra di contesto?
La finestra di contesto è di 100.000 token, che includono sia il prompt di input che il completamento di output. Il massimo output per richiesta è di 32.000 token, o 2.048 token se non specifichi un parametro max_tokens.
La tua chiave è a un modulo di distanza
Crea un account, copia la chiave, cambia l'URL di base. È tutta la configurazione.