Mô hình Abliterated: Chi phí, Ngữ cảnh và Mã
Các mô hình Abliterated là mô hình ngôn ngữ lớn nơi các cơ chế thực hiện từ chối an toàn đã được loại bỏ, cho phép mô hình trả lời các câu hỏi gây tranh cãi, người lớn hoặc chuyên biệt mà không bị chặn bởi bộ lọc nội dung. Cách tiếp cận này mang lại cho nhà phát triển quyền kiểm soát hoàn toàn giọng điệu và ngưỡng cắt kiến thức của mô hình, điều này đặc biệt có giá trị cho lập trình, nhập vai và viết sáng tạo nơi các hàng rào bảo vệ tiêu chuẩn có thể chặn đầu ra hữu ích.
Cập nhật
Điểm chính
- Các mô hình Abliterated sử dụng một tệp trọng lượng duy nhất nơi hành vi từ chối đã được tinh chỉnh, thay vì dựa vào các API kiểm duyệt bên ngoài.
- API được lưu trữ của chúng tôi cung cấp cửa sổ ngữ cảnh 100.000 token và các endpoint tương thích OpenAI để tích hợp liền mạch.
- Giá cả được tính theo từng lần sử dụng với tín dụng trả trước bằng tiền điện tử, vì vậy bạn chỉ trả tiền cho các token thực sự được sử dụng.
- Mô hình là một kiến trúc trọng số mở độc lập, không phải là phiên bản đóng gói lại của Llama, Mistral hoặc các mô hình của nhà cung cấp khác.
Mô hình Abliterated là gì?
Mô hình Abliterated được tạo ra bằng cách lấy một mô hình ngôn ngữ trọng số mở hiện có và loại bỏ hoặc làm suy yếu có hệ thống các đường dẫn thần kinh khiến nó từ chối một số loại nội dung nhất định. Không giống như các mô hình tiêu chuẩn có thể lịch sự từ chối thảo luận về một chủ đề vì chính sách an toàn, một mô hình đã loại bỏ cơ chế từ chối sẽ trả lời câu hỏi một cách trực tiếp. Quy trình thường liên quan đến việc xác định các 'đầu chú ý' chịu trách nhiệm cho việc từ chối và đặt ảnh hưởng của chúng gần bằng không, hoặc tinh chỉnh mô hình trên một tập dữ liệu khuyến khích trả lời toàn diện.
Kết quả là một mô hình giữ nguyên trí thông minh và khả năng suy luận cơ bản nhưng thiếu lớp 'lọc'. Điều này có nghĩa là nó có thể thảo luận về các chủ đề người lớn, ý kiến gây tranh cãi hoặc các chủ đề kỹ thuật chuyên biệt mà không tạo ra thông báo từ chối. Điều quan trọng cần lưu ý là 'không kiểm duyệt' không có nghĩa là 'không thông minh'; mô hình vẫn tuân theo hướng dẫn và duy trì tính mạch lạc. Tuy nhiên, nó cũng có thể phản ánh các thiên kiến hoặc lỗi có trong dữ liệu huấn luyện cơ bản mà không có sự tinh chỉnh doanh nghiệp thông thường.
- Tính toàn vẹn của mô hình cơ sở: Kỹ năng suy luận và ngôn ngữ cốt lõi vẫn được giữ nguyên.
- Loại bỏ từ chối: Các cơ chế cụ thể kích hoạt bộ lọc nội dung đã được làm suy yếu.
- Tệp trọng lượng đơn lẻ: Toàn bộ mô hình, bao gồm trạng thái đã loại bỏ cơ chế từ chối, được chứa trong một tệp.
Chi phí suy luận không kiểm duyệt
Chạy một mô hình không kiểm duyệt cục bộ yêu cầu phần cứng đáng kể, thường là GPU với ít nhất 24GB VRAM cho các mô hình kích thước trung bình. Đối với các nhà phát triển cần độ tin cậy và khả năng mở rộng, việc tự lưu trữ mô hình sẽ tạo ra chi phí vận hành. API của chúng tôi cung cấp một mô hình giá cả dự đoán được, trả theo từng lần sử dụng, loại bỏ nhu cầu quản lý GPU.
Chúng tôi tính $0,25 cho mỗi 1 triệu token đầu vào và $1,00 cho mỗi 1 triệu token đầu ra. Không có gói đăng ký hàng tháng hoặc phí ẩn. Bạn nạp trước tín dụng bằng tiền điện tử (USDT trên TRC20 hoặc USDC trên Base), và tín dụng không bao giờ hết hạn. Các lỗi trong yêu cầu của bạn miễn phí, vì vậy bạn chỉ trả tiền cho việc sử dụng thực tế. Mô hình này rất lý tưởng cho các startup hoặc nhà phát triển độc lập muốn thử nghiệm một mô hình mà không cam kết chi phí hàng tháng cố định.
| Loại sử dụng | Chi phí trên 1 triệu Token |
|---|---|
| Token đầu vào | $0.25 |
| Token đầu ra | $1.00 |
Bạn có thể nạp tiền vào tài khoản của mình với bất kỳ số nguyên nào từ $10 đến $500. Nếu bạn thêm $50 trở lên, bạn nhận được 5% tín dụng bổ sung; thêm $100 trở lên sẽ được tặng 10% tín dụng bổ sung. Cấu trúc này đảm bảo chi phí cơ sở hạ tầng của bạn tăng tuyến tính với lưu lượng truy cập ứng dụng của bạn.
Ưu điểm cửa sổ ngữ cảnh
Một trong những yếu tố quan trọng nhất đối với các nhà phát triển làm việc với tài liệu dài, cơ sở mã hoặc các cuộc trò chuyện phức tạp là cửa sổ ngữ cảnh. API của chúng tôi cung cấp cửa sổ ngữ cảnh 100.000 token, cho phép mô hình xử lý và giữ một lượng lớn thông tin trong một yêu cầu duy nhất. Điều này lớn hơn đáng kể so với giới hạn 8.000 token tiêu chuẩn có trong nhiều mô hình cũ hơn hoặc nhỏ hơn.
Cửa sổ ngữ cảnh 100k cho phép một số trường hợp sử dụng nâng cao. Bạn có thể chuyển toàn bộ kho lưu trữ mã dưới dạng ngữ cảnh, cho phép mô hình hiểu các phụ thuộc giữa các tệp. Bạn cũng có thể duy trì các cuộc trò chuyện dài, mạch lạc mà không để mô hình quên các hướng dẫn trước đó. Cửa sổ ngữ cảnh bao gồm cả prompt đầu vào và kết quả đầu ra, vì vậy bạn cần lập kế hoạch ngân sách token của mình cẩn thận.
- Phân tích mã: Chuyển nhiều tệp để nhận các đề xuất có ngữ cảnh.
- Cuộc trò chuyện dài: Duy trì trạng thái qua nhiều lượt mà không bị lạc đề.
- Tóm tắt tài liệu: Xử lý các khối văn bản lớn trong một lệnh gọi.
Hãy nhớ rằng lượng đầu ra tối đa cho mỗi yêu cầu là 32.000 token. Nếu bạn không chỉ định tham số max_tokens, mô hình sẽ mặc định là 2.048 token. Giới hạn này đảm bảo hiệu suất ổn định ngay cả khi xử lý các đầu vào lớn.
Hiệu suất lập trình
Các mô hình không kiểm duyệt đặc biệt có giá trị cho các nhiệm vụ lập trình vì chúng ít có khả năng từ chối các yêu cầu có thể được coi là 'không an toàn' bởi các bộ lọc tiêu chuẩn. Ví dụ: một mô hình tiêu chuẩn có thể từ chối tạo một payload tiêm SQL cho nghiên cứu bảo mật, trong khi một mô hình đã loại bỏ cơ chế từ chối sẽ cung cấp nó trực tiếp. Điều này làm cho chúng trở nên lý tưởng cho các nhà phát triển cần đầu ra thô, không lọc để phân tích, gỡ lỗi hoặc lập trình sáng tạo.
Mô hình hỗ trợ gọi hàm, cho phép bạn xác định các công cụ và có mô hình trả về các phản hồi JSON có cấu trúc. Điều này rất cần thiết để xây dựng các tác nhân AI có thể tương tác với các API hoặc cơ sở dữ liệu bên ngoài. Bạn cũng có thể buộc chế độ JSON để đảm bảo đầu ra của mô hình luôn là JSON hợp lệ, giúp đơn giản hóa việc phân tích cú pháp trong ứng dụng của bạn.
Khi tích hợp API, bạn có thể sử dụng các SDK chính thức của OpenAI hoặc bất kỳ khách hàng tương thích OpenAI nào. URL cơ sở là https://api.abliterated.cc/v1, và bạn gửi yêu cầu đến endpoint /v1/chat/completions. ID mô hình đơn giản là uncensored.
Sử dụng công cụ & Gọi hàm
Gọi hàm là một tính năng quan trọng để xây dựng các ứng dụng AI thực tế. API của chúng tôi hỗ trợ điều này một cách bản địa, cho phép bạn xác định lược đồ của các công cụ và có mô hình quyết định gọi công cụ nào và với đối số nào. Mô hình trả về một phản hồi có cấu trúc mà bạn có thể phân tích cú pháp và thực thi trong mã của mình.
Bạn có thể chỉ định tham số tool_choice để buộc mô hình gọi một công cụ cụ thể hoặc chọn tự động. Sự linh hoạt này hữu ích cho việc tạo các tác nhân có thể thực hiện nhiều hành động, chẳng hạn như tìm kiếm cơ sở dữ liệu, cập nhật hồ sơ người dùng hoặc gửi email.
- Đầu ra có cấu trúc: Sử dụng
response_formatđặt thànhjson_objectđể đảm bảo JSON hợp lệ. - Định nghĩa công cụ: Xác định các công cụ trong mảng
toolsvới tên, mô tả và các tham số. - Thực thi: Phân tích cú pháp phản hồi của mô hình và thực thi hàm tương ứng trong mã của bạn.
API hỗ trợ các tham số như temperature, top_p, stop, seed, presence_penalty và frequency_penalty để tinh chỉnh hành vi của mô hình. Điều này cho phép bạn cân bằng giữa sáng tạo và độ chính xác tùy thuộc vào trường hợp sử dụng của bạn.
Hiệu quả truyền phát
Truyền phát (streaming) rất quan trọng để mang lại trải nghiệm người dùng tốt trong các ứng dụng chat. API của chúng tôi hỗ trợ Server-Sent Events (SSE), cho phép bạn nhận phản hồi của mô hình từng token một theo thời gian thực. Điều này làm giảm độ trễ cảm nhận được đối với người dùng, vì họ thấy phản hồi xuất hiện dần dần thay vì phải chờ đợi toàn bộ phản hồi được tạo ra.
Khi truyền phát, API bao gồm thông tin sử dụng token trong chunk cuối cùng. Điều này cho phép bạn theo dõi mức tiêu thụ token của mình theo thời gian thực và dừng luồng nếu bạn tiến gần đến giới hạn ngân sách của mình. Giao diện truyền phát tương thích với tất cả các SDK OpenAI tiêu chuẩn, giúp dễ dàng tích hợp vào các ứng dụng hiện có.
Một sự đánh đổi cần xem xét là truyền phát đôi khi có thể dẫn đến số lượng token cao hơn một chút so với các yêu cầu không truyền phát, vì mô hình có thể tạo ra các từ đệm hoặc do dự. Tuy nhiên, lợi ích của việc phản hồi ngay lập tức thường vượt xa chi phí nhỏ này. Bạn cũng có thể sử dụng tham số stop để dừng quá trình tạo sớm nếu mô hình bắt đầu lặp lại hoặc đi chệch hướng.
Quyền riêng tư dữ liệu & Huấn luyện
Đối với nhiều nhà phát triển, quyền riêng tư dữ liệu là mối quan tâm hàng đầu. Khi bạn sử dụng API của chúng tôi, các prompt của bạn sẽ không được sử dụng để huấn luyện. Điều này có nghĩa là dữ liệu bạn gửi đến mô hình vẫn được bảo mật và không được sử dụng để cải thiện mô hình cơ sở hoặc chia sẻ với các bên thứ ba. Đây là một lợi thế đáng kể so với một số nhà cung cấp lớn sử dụng dữ liệu khách hàng để huấn luyện.
Để đăng ký, bạn chỉ cần một địa chỉ email. Bạn có thể đăng nhập bằng Google hoặc sử dụng email và mật khẩu. Không cần số điện thoại và không cần thẻ tín dụng cho bản dùng thử. Bản dùng thử bao gồm $0.50 tín dụng có giá trị trong 7 ngày, cho phép bạn kiểm tra API trước khi cam kết với gói trả phí.
Có một giới hạn nội dung cứng luôn được áp dụng: mô hình sẽ từ chối các yêu cầu liên quan đến nội dung tình dục với trẻ vị thành niên. Tất cả các chủ đề hợp pháp khác dành cho người trưởng thành, gây tranh cãi hoặc chuyên biệt đều được cho phép. Điều này đảm bảo rằng mô hình vẫn có thể sử dụng được cho nhiều loại ứng dụng khác nhau mà không có các hạn chế không mong đợi.
Tại sao chọn API thay vì chạy cục bộ?
Chạy một mô hình cục bộ cho bạn quyền kiểm soát hoàn toàn đối với dữ liệu và cơ sở hạ tầng, nhưng nó đòi hỏi phần cứng và chuyên môn kỹ thuật đáng kể. Bạn cần quản lý trình điều khiển GPU, phân bổ bộ nhớ và cập nhật mô hình. Đối với nhiều nhà phát triển, đặc biệt là những người đang xây dựng nguyên mẫu hoặc các ứng dụng quy mô nhỏ, chi phí vận hành này không đáng giá.
API của chúng tôi cung cấp một giải pháp lưu trữ xử lý tất cả cơ sở hạ tầng. Bạn có một endpoint đáng tin cậy, có thể mở rộng với giá cả dự đoán được. API hỗ trợ 300 yêu cầu mỗi phút và tối đa 8 yêu cầu đồng thời mỗi khóa, điều này đủ cho hầu hết các ứng dụng nhỏ đến vừa. Nếu bạn cần các giới hạn cao hơn, bạn có thể liên hệ bộ phận hỗ trợ.
Một lợi thế khác là sự dễ dàng trong tích hợp. Bạn có thể sử dụng cùng mã bạn sẽ sử dụng cho GPT-4, chỉ bằng cách thay đổi URL cơ sở và khóa API. Điều này làm giảm đường cong học tập và cho phép bạn chuyển đổi giữa các mô hình nếu cần. API không bị ràng buộc với bất kỳ nhà cung cấp cụ thể nào, vì vậy bạn không bị khóa trong một hệ sinh thái duy nhất.
Bắt đầu với Abliterated
Bắt đầu với API của chúng tôi rất đơn giản. Đầu tiên, hãy đăng ký tài khoản bằng email hoặc Google của bạn. Bạn sẽ nhận được một khóa API ngay lập tức, mà bạn có thể sử dụng để xác thực các yêu cầu của mình. Bạn cũng có thể sử dụng tín dụng dùng thử để kiểm tra API mà không cần nhập thông tin thanh toán.
Để thực hiện yêu cầu đầu tiên của bạn, hãy sử dụng phương thức POST trên endpoint /v1/chat/completions. Đặt tham số model thành uncensored và bao gồm prompt của bạn trong mảng messages. Bạn cũng có thể chỉ định các tham số như temperature và max_tokens để kiểm soát đầu ra.
Hỏi đáp
Mô hình này có dựa trên Llama hay Mistral không?
Không. Mô hình là một kiến trúc trọng số mở độc lập. Nó không phải là GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama hoặc bất kỳ mô hình của nhà cung cấp nào khác. Đó là một mô hình độc đáo được tinh chỉnh cho hành vi không kiểm duyệt.
Tôi có thể sử dụng API với các SDK chính thức của OpenAI không?
Có. API tương thích hoàn toàn với OpenAI. Bạn có thể sử dụng các SDK chính thức của OpenAI hoặc bất kỳ khách hàng nào hỗ trợ định dạng API OpenAI bằng cách đặt URL cơ sở thành https://api.abliterated.cc/v1 và cung cấp khóa API của bạn.
Tôi thanh toán API như thế nào?
Chúng tôi chỉ chấp nhận tiền điện tử: USDT trên mạng TRC20 hoặc USDC trên mạng Base. Bạn có thể nạp tiền với bất kỳ số nguyên nào từ $10 đến $500. Không có gói đăng ký hàng tháng hoặc phí thẻ tín dụng.
Kích thước cửa sổ ngữ cảnh là bao nhiêu?
Cửa sổ ngữ cảnh là 100.000 token, bao gồm cả prompt đầu vào và phần hoàn thành đầu ra. Đầu ra tối đa mỗi yêu cầu là 32.000 token, hoặc 2.048 token nếu bạn không chỉ định tham số max_tokens.
Khóa của bạn chỉ cách một biểu mẫu
Tạo tài khoản, sao chép khóa, thay đổi URL cơ sở. Đó là toàn bộ quá trình thiết lập.