Modèles Abliterated : coût, contexte et code
Les modèles Abliterated sont des grands modèles de langage dont les mécanismes imposant les refus de sécurité ont été supprimés, permettant au modèle de répondre à des questions controversées, pour adultes ou de niche sans déclencher de filtre de contenu. Cette approche donne aux développeurs un contrôle total sur la voix du modèle et sa date de coupure des connaissances, ce qui est particulièrement précieux pour le codage, le jeu de rôle et l'écriture créative où les garde-fous standard pourraient bloquer des sorties utiles.
Mis à jour
Points clés
- Les modèles Abliterated utilisent un seul fichier de poids où les comportements de refus sont atténués, plutôt que de s'appuyer sur des API de modération externes.
- Notre API hébergée offre une fenêtre de contexte de 100 000 tokens et des endpoints compatibles OpenAI pour une intégration transparente.
- La tarification est strictement à l'usage avec un crédit crypto prépayé, vous ne payez donc que pour les tokens réellement consommés.
- Le modèle est une architecture à poids ouverts indépendante, et non une version remaniée de Llama, Mistral ou d'autres modèles de fournisseurs.
Qu'est-ce que les modèles Abliterated ?
Les modèles Abliterated sont créés en prenant un modèle de langage à poids ouverts existant et en supprimant ou en atténuant systématiquement les voies neurales qui provoquent le refus de certains types de contenu. Contrairement aux modèles standards qui pourraient décliner poliment de discuter d'un sujet en raison d'une politique de sécurité, un modèle ablitré répondra directement à la question. Le processus implique généralement d'identifier les « têtes d'attention » responsables du refus et de définir leur influence à près de zéro, ou d'ajuster le modèle sur un jeu de données qui encourage des réponses exhaustives.
Le résultat est un modèle qui conserve son intelligence et ses capacités de raisonnement de base, mais qui ne dispose pas de la couche de « filtrage ». Cela signifie qu'il peut aborder des thèmes pour adultes, des opinions controversées ou des sujets techniques de niche sans générer de message de refus. Il est important de noter que « sans censure » ne signifie pas « peu intelligent » ; le modèle suit toujours les instructions et maintient sa cohérence. Cependant, il peut également refléter les biais ou les erreurs présents dans les données d'entraînement de base sans le polissage habituel des entreprises.
- Intégrité du modèle de base : Les compétences fondamentales de raisonnement et de langage restent intactes.
- Suppression des refus : Les mécanismes spécifiques déclenchant les filtres de contenu sont atténués.
- Fichier de poids unique : L'intégralité du modèle, y compris l'état ablitré, est contenue dans un seul fichier.
Le coût de l'inférence sans censure
L'exécution d'un modèle sans censure localement nécessite du matériel important, généralement un GPU avec au moins 24 Go de VRAM pour les modèles de taille moyenne. Pour les développeurs qui ont besoin de fiabilité et de mise à l'échelle, l'hébergement du modèle vous-même introduit une charge opérationnelle. Notre API propose un modèle de tarification prévisible à l'usage qui élimine le besoin de gérer les GPU.
Nous facturons 0,25 $ par million de tokens d'entrée et 1,00 $ par million de tokens de sortie. Il n'y a pas d'abonnements mensuels ni de frais cachés. Vous préchargez du crédit à l'aide de cryptomonnaies (USDT sur TRC20 ou USDC sur Base), et le crédit n'expire jamais. Les erreurs dans vos requêtes sont gratuites, vous ne payez que pour l'utilisation réelle. Ce modèle est idéal pour les startups ou les développeurs indépendants qui souhaitent tester un modèle sans s'engager dans un coût mensuel fixe.
| Type d'utilisation | Coût par 1M de tokens |
|---|---|
| Tokens d'entrée | $0.25 |
| Tokens de sortie | $1.00 |
Vous pouvez recharger votre compte avec n'importe quel montant entier entre 10 $ et 500 $. Si vous ajoutez 50 $ ou plus, vous recevez un bonus de 5 % en crédit ; ajouter 100 $ ou plus accorde un bonus de 10 %. Cette structure garantit que vos coûts d'infrastructure évoluent linéairement avec le trafic de votre application.
Avantages de la fenêtre de contexte
L'un des facteurs les plus critiques pour les développeurs travaillant avec de longs documents, des bases de code ou des conversations complexes est la fenêtre de contexte. Notre API fournit une fenêtre de contexte de 100 000 tokens, ce qui permet au modèle de traiter et de retenir une grande quantité d'informations au sein d'une seule requête. C'est significativement plus grand que les limites standard de 8 000 tokens trouvées dans de nombreux modèles plus anciens ou plus petits.
Une fenêtre de contexte de 100k permet plusieurs cas d'utilisation avancés. Vous pouvez passer un dépôt de code entier comme contexte, permettant au modèle de comprendre les dépendances entre fichiers. Vous pouvez également maintenir des conversations longues et cohérentes sans que le modèle oublie les instructions antérieures. La fenêtre de contexte inclut à la fois le prompt d'entrée et la réponse générée, vous devez donc planifier soigneusement votre budget de tokens.
- Analyse de code : Transmettez plusieurs fichiers pour obtenir des suggestions conscientes du contexte.
- Conversations longues : Maintenez l'état sur des dizaines de tours sans perdre le fil du sujet.
- Résumé de documents : Traitez de grands blocs de texte en un seul appel.
Gardez à l'esprit que la sortie maximale par requête est de 32 000 tokens. Si vous ne spécifiez pas le paramètre max_tokens, le modèle utilisera par défaut 2 048 tokens. Cette limite garantit des performances stables même lors du traitement de grandes entrées.
Performance de codage
Les modèles sans censure sont particulièrement précieux pour les tâches de codage car ils sont moins susceptibles de refuser des requêtes qui pourraient être considérées comme « dangereuses » par les filtres standards. Par exemple, un modèle standard pourrait refuser de générer une charge d'injection SQL pour la recherche en sécurité, tandis qu'un modèle ablitré le fournira directement. Cela les rend idéaux pour les développeurs qui ont besoin d'une sortie brute et non filtrée pour l'analyse, le débogage ou le codage créatif.
Le modèle prend en charge l'appel de fonctions, ce qui vous permet de définir des outils et d'avoir le modèle qui retourne des réponses JSON structurées. C'est essentiel pour construire des agents IA capables d'interagir avec des API ou des bases de données externes. Vous pouvez également imposer le mode JSON pour s'assurer que la sortie du modèle est toujours un JSON valide, ce qui simplifie l'analyse dans votre application.
Lors de l'intégration de l'API, vous pouvez utiliser les SDK officiels OpenAI ou tout client compatible OpenAI. L'URL de base est https://api.abliterated.cc/v1, et vous envoyez des requêtes à l'endpoint /v1/chat/completions. L'ID du modèle est simplement uncensored.
Utilisation des outils et appel de fonctions
L'appel de fonctions est une fonctionnalité critique pour la création d'applications IA pratiques. Notre API prend en charge cette fonctionnalité nativement, vous permettant de définir un schéma d'outils et d'avoir le modèle qui décide quel outil appeler et avec quels arguments. Le modèle retourne une réponse structurée que vous pouvez analyser et exécuter dans votre code.
Vous pouvez spécifier le paramètre tool_choice pour forcer le modèle à appeler un outil spécifique ou à choisir automatiquement. Cette flexibilité est utile pour créer des agents capables d'effectuer plusieurs actions, telles que la recherche dans une base de données, la mise à jour du profil d'un utilisateur ou l'envoi d'un e-mail.
- Sortie structurée : Utilisez
response_formatdéfini surjson_objectpour assurer un JSON valide. - Définitions d'outils : Définissez des outils dans le tableau
toolsavec le nom, la description et les paramètres. - Exécution : Analysez la réponse du modèle et exécutez la fonction correspondante dans votre code.
L'API prend en charge des paramètres comme temperature, top_p, stop, seed, presence_penalty et frequency_penalty pour ajuster finement le comportement du modèle. Cela vous permet de faire le compromis entre créativité et précision en fonction de votre cas d'utilisation.
Efficacité du streaming
Le streaming est essentiel pour offrir une bonne expérience utilisateur dans les applications de chat. Notre API prend en charge les Server-Sent Events (SSE), ce qui vous permet de recevoir la réponse du modèle token par token en temps réel. Cela réduit la latence perçue pour l'utilisateur, car il voit la réponse apparaître progressivement au lieu d'attendre la génération de la réponse complète.
En streaming, l'API inclut les informations d'utilisation des tokens dans le dernier bloc. Cela vous permet de suivre votre consommation de tokens en temps réel et d'arrêter le streaming si vous approchez de vos limites de budget. L'interface de streaming est compatible avec tous les SDK OpenAI standards, ce qui facilite l'intégration dans les applications existantes.
Un compromis à considérer est que le streaming peut parfois entraîner des comptes de tokens légèrement plus élevés par rapport aux requêtes hors streaming, car le modèle peut générer des mots de remplissage ou hésiter. Cependant, l'avantage d'un retour immédiat l'emporte souvent sur ce coût mineur. Vous pouvez également utiliser le paramètre stop pour arrêter la génération prématurément si le modèle commence à se répéter ou à s'égarer.
Confidentialité des données et entraînement
Pour de nombreux développeurs, la confidentialité des données est une préoccupation majeure. Lorsque vous utilisez notre API, vos prompts ne sont pas utilisés pour l'entraînement. Cela signifie que les données que vous envoyez au modèle restent privées et ne sont pas utilisées pour améliorer le modèle de base ni partagées avec des tiers. C'est un avantage significatif par rapport à certains grands fournisseurs qui utilisent les données des clients pour l'entraînement.
Pour vous inscrire, vous n'avez besoin que d'une adresse e-mail. Vous pouvez vous connecter avec Google ou utiliser un e-mail et un mot de passe. Aucun numéro de téléphone n'est requis, et aucune carte de crédit n'est nécessaire pour l'essai. L'essai inclut 0,50 $ de crédit valable 7 jours, vous permettant de tester l'API avant de vous engager dans un plan payant.
Il existe une limite de contenu stricte qui s'applique toujours : le modèle refusera les requêtes impliquant du contenu sexuel avec des mineurs. Tous les autres sujets adultes, controversés ou de niche, s'ils sont légaux, sont autorisés. Cela garantit que le modèle reste utilisable pour un large éventail d'applications sans restrictions inattendues.
Pourquoi choisir une API plutôt qu'une solution locale ?
L'exécution d'un modèle en local vous donne un contrôle total sur les données et l'infrastructure, mais cela nécessite du matériel important et une expertise technique. Vous devez gérer les pilotes GPU, l'allocation de la mémoire et les mises à jour du modèle. Pour de nombreux développeurs, en particulier ceux qui créent des prototypes ou des applications à petite échelle, cette surcharge n'en vaut pas la peine.
Notre API fournit une solution hébergée qui gère toute l'infrastructure. Vous bénéficiez d'un endpoint fiable et évolutif avec une tarification prévisible. L'API prend en charge 300 requêtes par minute et jusqu'à 8 requêtes simultanées par clé, ce qui est suffisant pour la plupart des applications de petite à moyenne taille. Si vous avez besoin de limites plus élevées, vous pouvez contacter le support.
Un autre avantage est la facilité d'intégration. Vous pouvez utiliser le même code que celui que vous utiliseriez pour GPT-4, en modifiant simplement l'URL de base et la clé API. Cela réduit la courbe d'apprentissage et vous permet de passer d'un modèle à l'autre si nécessaire. L'API n'est liée à aucun fournisseur spécifique, vous n'êtes donc pas lié à un seul écosystème.
Premiers pas avec Abliterated
Commencer avec notre API est simple. Inscrivez-vous d'abord à un compte à l'aide de votre adresse e-mail ou de votre compte Google. Vous recevrez immédiatement une clé API que vous pourrez utiliser pour authentifier vos requêtes. Vous pouvez également utiliser le crédit d'essai pour tester l'API sans saisir d'informations de paiement.
Pour effectuer votre première requête, utilisez la méthode POST sur l'endpoint /v1/chat/completions. Définissez le paramètre model sur uncensored et incluez votre prompt dans le tableau messages. Vous pouvez également spécifier des paramètres comme temperature et max_tokens pour contrôler la sortie.
Questions et réponses
Ce modèle est-il basé sur Llama ou Mistral ?
Non. Le modèle est une architecture open-weight indépendante. Il ne s'agit pas de GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama ou de tout autre modèle de fournisseur. C'est un modèle unique ajusté pour un comportement sans censure.
Puis-je utiliser l'API avec les SDK officiels OpenAI ?
Oui. L'API est entièrement compatible avec OpenAI. Vous pouvez utiliser les SDK officiels OpenAI ou tout client qui prend en charge le format de l'API OpenAI en définissant l'URL de base sur https://api.abliterated.cc/v1 et en fournissant votre clé API.
Comment payer l'API ?
Nous acceptons uniquement les cryptomonnaies : USDT sur le réseau TRC20 ou USDC sur le réseau Base. Vous pouvez recharger avec n'importe quel montant entier entre 10 $ et 500 $. Il n'y a pas d'abonnements mensuels ni de frais de carte bancaire.
Quelle est la taille de la fenêtre de contexte ?
La fenêtre de contexte est de 100 000 tokens, ce qui inclut à la fois le prompt d'entrée et la complétion de sortie. La sortie maximale par requête est de 32 000 tokens, ou 2 048 tokens si vous ne spécifiez pas le paramètre max_tokens.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.