Abliterated 模型:成本、上下文与代码
Abliterated 模型是大语言模型,其中执行安全拒绝的机制已被移除,允许模型在不触发内容过滤器的情况下回答争议性、成人或小众问题。这种方法让开发者完全控制模型的语气和知识截止日期,对于编码、角色扮演和创意写作尤其有价值,因为标准护栏可能会阻止有用的输出。
已更新
要点
- Abliterated 模型使用单个权重文件,其中拒绝行为已被去除,而不是依赖外部审核 API。
- 我们的托管 API 提供 100,000 token 的上下文窗口和 OpenAI 兼容的接口,实现无缝集成。
- 定价严格采用按量付费模式,使用预付加密货币额度,因此你只需为实际消耗的 token 付费。
- 该模型是独立的开放权重架构,不是 Llama、Mistral 或其他厂商模型的重新打包版本。
什么是 Abliterated 模型?
Abliterated 模型是通过获取现有的开放权重语言模型,并系统地移除或减弱导致其拒绝特定类型内容的神经通路而创建的。与因安全策略而礼貌拒绝讨论某个话题的标准模型不同,abliterated 模型会直接回答问题。该过程通常涉及识别负责拒绝的“注意力头”,并将其影响设置为接近零,或在鼓励全面回答的数据集上对模型进行微调。
结果是一个保留基础智能和推理能力但缺乏“过滤”层的模型。这意味着它可以讨论成人主题、争议性观点或小众技术话题,而不会生成拒绝消息。需要注意的是,“无审查”并不意味着“无智能”;模型仍然遵循指令并保持连贯性。然而,它也可能反映基础训练数据中存在的偏见或错误,而没有通常的企业修饰。
- 基础模型完整性: 核心推理和语言能力保持完整。
- 拒绝移除: 触发内容过滤器的特定机制被减弱。
- 单权重文件: 整个模型,包括 abliterated 状态,都包含在一个文件中。
无审查推理的成本
在本地运行无审查模型需要大量硬件,通常中型模型至少需要 24GB VRAM 的 GPU。对于需要可靠性和扩展性的开发者来说,自行托管模型会带来运营开销。我们的 API 提供可预测的按量付费定价模式,消除了管理 GPU 的需求。
我们收取每 100 万输入 token $0.25 的费用,每 100 万输出 token $1.00 的费用。没有月度订阅或隐藏费用。你使用加密货币(TRC20 上的 USDT 或 Base 上的 USDC)预存额度,额度永不过期。请求中的错误免费,因此你只为实际使用付费。这种模式非常适合希望在不承诺固定月度成本的情况下测试模型的初创公司或独立开发者。
| 使用类型 | 每 1M Token 的成本 |
|---|---|
| 输入 token | $0.25 |
| 输出 token | $1.00 |
你可以使用 10 美元至 500 美元之间的任意金额充值账户。如果添加 50 美元或更多,你将获得 5% 的额度奖励;添加 100 美元或更多可获得 10% 的奖励。这种结构确保你的基础设施成本随应用程序流量线性扩展。
上下文窗口优势
对于处理长文档、代码库或复杂对话的开发者来说,最关键的因素之一是上下文窗口。我们的 API 提供 100,000-token 的上下文窗口,允许模型在单个请求中处理和保留大量信息。这远大于许多较旧或较小模型中常见的 8,000-token 限制。
100k 上下文窗口支持几种高级用例。你可以将整个代码库作为上下文传递,使模型能够理解跨文件依赖。你还可以保持长而连贯的对话,而不会让模型忘记之前的指令。上下文窗口包括输入提示词和输出补全,因此你需要仔细规划 token 预算。
- 代码分析: 传递多个文件以获取上下文感知的建议。
- 长对话: 在数十轮对话中保持状态,而不丢失话题线索。
- 文档摘要: 在单次调用中处理大块文本。
请注意,每个请求的最大输出为 32,000 token。如果你未指定 max_tokens 参数,模型将默认为 2,048 token。此限制确保在处理大输入时性能稳定。
编码性能
无审查模型在编码任务中特别有价值,因为它们不太可能拒绝标准过滤器可能视为“不安全”的请求。例如,标准模型可能会拒绝为安全研究生成 SQL 注入有效载荷,而 abliterated 模型会直接提供。这使得它们成为需要原始、无过滤输出进行分析、调试或创意编码的开发者的理想选择。
该模型支持函数调用,允许你定义工具并让模型返回结构化的 JSON 响应。这对于构建可以与外部 API 或数据库交互的 AI 代理至关重要。你还可以强制执行 JSON 模式,以确保模型的输出始终是有效的 JSON,从而简化应用程序中的解析。
集成 API 时,你可以使用官方 OpenAI SDK 或任何 OpenAI 兼容客户端。基础 URL 是 https://api.abliterated.cc/v1,你向 /v1/chat/completions 接口发送请求。模型 ID 仅为 uncensored。
工具使用与函数调用
函数调用是构建实用 AI 应用的关键功能。我们的 API 原生支持此功能,允许你定义工具架构,并让模型决定调用哪个工具以及使用什么参数。模型返回结构化响应,你可以在代码中解析并执行。
你可以指定 tool_choice 参数以强制模型调用特定工具或自动选择。这种灵活性对于创建可以执行多个操作的代理非常有用,例如搜索数据库、更新用户配置文件或发送电子邮件。
- 结构化输出: 使用
response_format设置为json_object以确保有效的 JSON。 - 工具定义: 在
tools数组中定义工具,包括名称、描述和参数。 - 执行: 解析模型的响应并在代码中执行相应的函数。
API 支持 temperature、top_p、stop、seed、presence_penalty 和 frequency_penalty 等参数,以微调模型行为。这允许你根据用例平衡创造力和精确度。
流式输出效率
流式输出对于在聊天应用中提供良好的用户体验至关重要。我们的 API 支持 Server-Sent Events (SSE),允许你实时以 token 为单位接收模型的响应。这降低了用户的感知延迟,因为他们可以看到响应逐渐出现,而不是等待整个响应生成完毕。
在流式输出时,API 会在最后一个数据块中包含 token 用量信息。这使你能够实时跟踪 token 消耗情况,并在接近预算限制时停止流。流式输出接口与所有标准的 OpenAI SDK 兼容,便于集成到现有应用中。
需要考虑的一个权衡是,流式输出有时会导致比非流式请求稍高的 token 计数,因为模型可能会生成填充词或犹豫。然而,即时反馈的好处通常超过这一微小成本。如果模型开始重复或偏离主题,你也可以使用 stop 参数提前停止生成。
数据隐私与训练
对于许多开发者来说,数据隐私是首要关注点。当你使用我们的 API 时,你的提示词不会用于训练。这意味着你发送给模型的数据保持私密,不会用于改进基础模型,也不会与第三方共享。与一些使用客户数据进行训练的主要供应商相比,这是一个显著优势。
注册只需邮箱。你可以使用 Google 账号登录,或使用邮箱和密码登录。无需手机号,试用无需信用卡。试用包含 7 天内有效的 $0.50 预付额度,让你在购买付费计划前测试 API。
有一个硬性内容限制始终适用:模型会拒绝涉及未成年人性内容的请求。所有其他合法的成人、争议性或利基话题均允许。这确保了模型可以在各种应用中正常使用,而不会出现意外限制。
为什么选择 API 而不是本地部署?
在本地运行模型让你完全控制数据和基础设施,但需要大量的硬件和技术专业知识。你需要管理 GPU 驱动程序、内存分配和模型更新。对于许多开发者,特别是那些构建原型或小型应用的开发者来说,这种开销并不值得。
我们的 API 提供托管解决方案,处理所有基础设施。你获得一个可靠、可扩展的接口,具有可预测的定价。API 支持每分钟 300 个请求和每个密钥最多 8 个并发请求,这对于大多数中小型应用程序来说已经足够。如果需要更高的限制,可以联系支持团队。
另一个优势是易于集成。你可以使用与 GPT-4 相同的代码,只需更改基础 URL 和 API 密钥。这降低了学习曲线,并允许你在需要时切换模型。API 不绑定任何特定供应商,因此你不会锁定在单一生态系统中。
Abliterated 入门
开始使用我们的 API 非常简单。首先,使用你的电子邮件或 Google 注册一个账户。你将立即获得一个 API 密钥,可用于验证你的请求。你也可以使用试用额度在无需输入支付信息的情况下测试 API。
要发出第一个请求,请在 /v1/chat/completions 接口上使用 POST 方法。将 model 参数设置为 uncensored,并在 messages 数组中包含你的提示词。你还可以指定 temperature 和 max_tokens 等参数来控制输出。
问答
该模型基于 Llama 或 Mistral 吗?
不是。该模型是一个独立的开放权重架构。它不是 GPT、Claude、Gemini、Grok、DeepSeek、Qwen、Llama 或任何其他供应商的模型。它是一个专为无审查行为调优的独特模型。
我可以将 API 与官方 OpenAI SDK 一起使用吗?
是的。该 API 完全兼容 OpenAI。你可以使用官方 OpenAI SDK 或任何支持 OpenAI API 格式的客户端,只需将 base URL 设置为 https://api.abliterated.cc/v1 并提供 API 密钥即可。
我如何为 API 付费?
我们仅接受加密货币:TRC20 网络上的 USDT 或 Base 网络上的 USDC。你可以充值 10 美元至 500 美元之间的任意整数金额。没有月度订阅或信用卡扣费。
上下文窗口大小是多少?
上下文窗口为 100,000 token,包括输入提示词和输出补全。每次请求的最大输出为 32,000 token,如果你未指定 max_tokens 参数,则为 2,048 token。
只差一张表单,即可获得密钥
创建账户,复制密钥,更改 base URL。这就是全部设置。