Abliteratedモデル:コスト、コンテキスト、コード
Abliteratedモデルは、安全性の拒否を強制するメカニズムが除去された大規模言語モデルです。これにより、モデルはコンテンツフィルタに引っかかることなく、論争の的となる質問、成人向けの内容、またはニッチな質問に回答できます。このアプローチにより、開発者はモデルのトーンと知識のカットオフを完全に制御でき、標準的なガードレールが有用な出力をブロックする可能性があるコーディング、ロールプレイ、クリエイティブライティングにおいて特に価値があります。
更新
主要ポイント
- Abliteratedモデルは、外部のモデレーションAPIに依存するのではなく、拒否動作が除去された単一のウェイトファイルを使用します。
- 当社のホスト型APIは、シームレスな統合のための100,000トークンのコンテキストウィンドウとOpenAI互換のエンドポイントを提供します。
- 価格は厳密に従量制で前払いの暗号通貨クレジットを使用するため、実際に消費されたトークンの分だけ支払います。
- このモデルはLlama、Mistral、またはその他のベンダーモデルのパッケージ化されたバージョンではなく、独立したオープンウェイトアーキテクチャです。
Abliteratedモデルとは?
Abliteratedモデルは、既存のオープンウェイト言語モデルを取得し、特定のコンテンツを拒否する原因となるニューラルパスウェイを体系的に除去または減衰させることで作成されます。安全ポリシーのためにトピックの議論を丁寧に断る可能性のある標準モデルとは異なり、abliteratedモデルは質問に直接回答します。このプロセスには、通常、拒否の原因となる「アテンションヘッド」を特定し、その影響をほぼゼロに設定するか、包括的な回答を促すデータセットでモデルをチューニングすることが含まれます。
結果として得られるモデルは、基礎的な知能と推論能力を維持しますが、「フィルタリング」レイヤーがありません。これは、成人向けテーマ、論争的な意見、またはニッチな技術トピックを、拒否メッセージを生成することなく議論できることを意味します。「無検閲」は「無知能」を意味するわけではないことに注意してください。モデルは依然として指示に従い、一貫性を維持します。ただし、通常のコーポレートな磨き上げなしで、ベースのトレーニングデータに含まれるバイアスやエラーを反映する可能性もあります。
- ベースモデルの整合性: コアの推論と言語スキルは維持されます。
- 拒否の除去: コンテンツフィルターをトリガーする特定のメカニズムが減衰します。
- 単一ウェイトファイル: abliterated状態を含むモデル全体が1つのファイルに含まれます。
無検閲推論のコスト
ローカルで無検閲モデルを実行するには、ミドルサイズのモデルで少なくとも24GBのVRAMを持つGPUなど、大きなハードウェアが必要です。信頼性とスケーラビリティを必要とする開発者にとって、モデルを自分でホストすることは運用上のオーバーヘッドをもたらします。当社のAPIは、GPU管理の必要性を排除する予測可能な従量制価格モデルを提供します。
入力トークン100万トークンあたり$0.25、出力トークン100万トークンあたり$1.00を請求します。月額サブスクリプションや隠れた料金はありません。暗号通貨(TRC20上のUSDTまたはBase上のUSDC)を使用してクレジットを前払いし、そのクレジットは期限切れになりません。リクエストのエラーは無料なので、実際の使用量に対してのみ課金されます。このモデルは、固定の月額コストにコミットせずにモデルをテストしたいスタートアップやインディー開発者に最適です。
| 使用タイプ | 100万トークンあたりのコスト |
|---|---|
| 入力トークン | $0.25 |
| 出力トークン | $1.00 |
アカウントには$10から$500の任意の金額でチャージできます。$50以上追加すると、クレジットの5%ボーナスが付与され、$100以上追加すると10%ボーナスが付与されます。この構造により、インフラコストはアプリケーションのトラフィックに線形にスケールします。
コンテキストウィンドウの利点
長いドキュメント、コードベース、または複雑な会話を取り扱う開発者にとって、最も重要な要因の1つがコンテキストウィンドウです。当社のAPIは100,000トークンのコンテキストウィンドウを提供し、1つのリクエスト内で大量の情報を処理・保持することを可能にします。これは、多くの古いまたは小さなモデルで見られる標準的な8,000トークンの制限よりも大幅に大きいです。
100kのコンテキストウィンドウは、いくつかの高度なユースケースを可能にします。コードリポジトリ全体をコンテキストとして渡すことができ、モデルがファイル間の依存関係を理解できるようにします。また、モデルが以前の指示を忘れないように、長く一貫性のある会話を維持することもできます。コンテキストウィンドウには入力プロンプトと出力補完の両方が含まれるため、トークン予算を慎重に計画する必要があります。
- コード分析: 複数のファイルを渡して、コンテキスト認識の提案を取得します。
- 長い会話: トピックの追跡を失うことなく、数十回のターンにわたって状態を維持します。
- ドキュメント要約: 1回の呼び出しで大きなテキストブロックを処理します。
リクエストごとの最大出力は32,000トークンである点にご注意ください。max_tokensパラメータを指定しない場合、モデルは2,048トークンをデフォルト値とします。この制限により、大規模な入力を処理する場合でも安定したパフォーマンスが確保されます。
コーディングパフォーマンス
無検閲モデルは、標準的なフィルターによって「安全でない」と見なされる可能性があるリクエストを拒否する可能性が低いため、コーディングタスクに特に価値があります。例えば、標準モデルはセキュリティ研究のためにSQLインジェクションペイロードの生成を拒否する可能性がありますが、abliteratedモデルはそれを直接提供します。これは、分析、デバッグ、またはクリエイティブコーディングのために生でフィルターなしの出力を必要とする開発者に最適です。
このモデルは関数呼び出しをサポートしており、ツールを定義してモデルに構造化されたJSONレスポンスを返すことができます。これは、外部APIやデータベースと対話できるAIエージェントを構築するために不可欠です。また、JSONモードを強制して、モデルの出力が常に有効なJSONであることを確認することもでき、アプリケーションでの解析が簡素化されます。
APIを統合する際、公式のOpenAI SDKまたはOpenAI互換のクライアントを使用できます。ベースURLはhttps://api.abliterated.cc/v1で、/v1/chat/completionsエンドポイントにリクエストを送信します。モデルIDは単にuncensoredです。
ツール使用と関数呼び出し
関数呼び出しは、実用的なAIアプリケーションを構築するための重要な機能です。当社のAPIはこれをネイティブにサポートしており、ツールのスキーマを定義し、モデルにどのツールを呼び出すか、そしてどのような引数で呼び出すかを判断させることができます。モデルは構造化されたレスポンスを返し、それをコードで解析して実行できます。
tool_choiceパラメータを指定することで、モデルに特定のツールを呼び出させたり、自動的に選択させたりすることができます。この柔軟性は、データベースの検索、ユーザープロファイルの更新、メールの送信など、複数のアクションを実行できるエージェントの作成に役立ちます。
- 構造化出力: 有効なJSONを確実に出力するには、
response_formatをjson_objectに設定してください。 - ツール定義:
tools配列にname、description、およびパラメータを定義してツールを定義します。 - 実行: モデルのレスポンスを解析し、対応する関数をコードで実行します。
APIは、モデルの動作を微調整するためのtemperature、top_p、stop、seed、presence_penalty、およびfrequency_penaltyなどのパラメータをサポートします。これにより、ユースケースに応じて創造性と精度のバランスを取ることができます。
ストリーミング効率
ストリーミングはチャットアプリケーションで良好なユーザー体験を提供するために不可欠です。当APIはServer-Sent Events (SSE)をサポートしており、モデルの応答をリアルタイムでトークン単位で受信できます。これにより、ユーザーは応答が生成されるのを待つことなく、段階的に表示されるため、知覚されるレイテンシが軽減されます。
ストリーミング時、APIは最終チャンクにトークン使用量情報を含めます。これにより、トークン消費をリアルタイムで追跡でき、予算制限に近づいた場合にストリームを停止できます。ストリーミングインターフェースはすべての標準的なOpenAI SDKと互換性があり、既存のアプリケーションへの統合が容易です。
考慮すべきトレードオフの1つは、ストリーミングは非ストリーミングリクエストと比較してトークン数がやや多くなる可能性があることです。これはモデルがフィラーを生成したり、考え込んだりする可能性があるためです。しかし、即時フィードバックの利点は、このわずかなコストを上回ることがほとんどです。モデルが繰り返しや脱線を始めたら、stopパラメータを使用して生成を早期に停止することもできます。
データプライバシーとトレーニング
多くの開発者にとって、データプライバシーは最優先事項です。当APIを使用する場合、あなたのプロンプトはトレーニングに使用されません。つまり、モデルに送信されたデータは非公開のままであり、ベースモデルの改善や第三者との共有には使用されません。これは、顧客データをトレーニングに使用する大手ベンダーと比較して大きな利点です。
サインアップするにはメールアドレスのみ必要です。Googleでサインインするか、メールアドレスとパスワードを使用できます。電話番号は必要なく、トライアルにはクレジットカードも不要です。トライアルには7日間有効な$0.50のクレジットが含まれており、有料プランにコミットする前にAPIをテストできます。
常に適用される1つのコンテンツ制限があります。それは、未成年者との性的コンテンツに関連するリクエストをモデルが拒否することです。それ以外の合法な大人向け、論争的、またはニッチなトピックはすべて許可されます。これにより、予期せぬ制限なく幅広いアプリケーションでモデルを使用できるようになります。
ローカルではなくAPIを選ぶ理由
モデルをローカルで実行すると、データとインフラストラクチャの完全な制御を得られますが、かなりのハードウェアと技術的専門知識が必要です。GPUドライバー、メモリ割り当て、モデルアップデートの管理が必要です。多くの開発者、特にプロトタイプや小規模アプリケーションを構築する開発者にとって、このオーバーヘッドは価値がありません。
当APIはすべてのインフラストラクチャを処理するホスト型ソリューションを提供します。信頼性が高く、スケーラブルなエンドポイントと予測可能な価格が得られます。APIは1分あたり300リクエスト、キーあたり最大8つの同時リクエストをサポートしており、ほとんどの小〜中規模アプリケーションに十分です。より高い制限が必要な場合は、サポートまでご連絡ください。
もう一つの利点は統合の容易さです。ベースURLとAPIキーを変更するだけで、GPT-4で使用する場合と同じコードを使用できます。これにより、学習曲線が軽減され、必要に応じてモデル間で切り替えることができます。APIは特定のベンダーに縛られていないため、単一のエコシステムにロックインされません。
Abliteratedの始め方
当社のAPIの使い始めは簡単です。まず、メールアドレスまたはGoogleを使用してアカウントにサインアップしてください。APIキーがすぐに発行され、それを使用してリクエストの認証を行うことができます。支払い情報を入力せずに、トライアルクレジットを使用してAPIをテストすることもできます。
最初のリクエストを行うには、/v1/chat/completionsエンドポイントでPOSTメソッドを使用します。modelパラメータをuncensoredに設定し、messages配列にプロンプトを含めます。出力を制御するためにtemperatureやmax_tokensなどのパラメータを指定することもできます。
質問と回答
このモデルはLlamaやMistralを基にしていますか?
いいえ。このモデルは独立したオープンウェイトアーキテクチャです。GPT、Claude、Gemini、Grok、DeepSeek、Qwen、Llama、またはその他のベンダーのモデルではありません。無検閲の動作にチューニングされた独自のモデルです。
公式のOpenAI SDKとAPIを使用できますか?
はい。APIはOpenAIと完全に互換性があります。ベースURLをhttps://api.abliterated.cc/v1に設定し、APIキーを提供することで、公式のOpenAI SDKまたはOpenAI API形式をサポートする任意のクライアントを使用できます。
APIの支払い方法はどうすればよいですか?
暗号通貨のみを受け付けます:TRC20ネットワーク上のUSDTまたはBaseネットワーク上のUSDC。$10から$500の任意の金額でチャージできます。月額サブスクリプションやクレジットカードの請求はありません。
コンテキストウィンドウのサイズはいくらですか?
コンテキストウィンドウは100,000トークンで、入力プロンプトと出力補完の両方を含みます。1つのリクエストあたりの最大出力は32,000トークン、またはmax_tokensパラメータを指定しない場合は2,048トークンです。
キーはフォーム 1 つで手に入ります
アカウントを作成し、キーをコピーし、ベースURLを変更するだけです。セットアップはこれだけです。