Modelos Abliterated: Costo, Contexto y Código
Los modelos Abliterated son modelos de lenguaje grandes donde se han eliminado los mecanismos que imponen las negativas de seguridad, lo que permite al modelo responder preguntas controversiales, para adultos o de nicho sin activar un filtro de contenido. Este enfoque da a los desarrolladores control total sobre la voz y el corte de conocimiento del modelo, lo cual es especialmente valioso para programación, roleplay y escritura creativa donde las barreras estándar podrían bloquear salidas útiles.
Actualizado
Puntos clave
- Los modelos Abliterated usan un único archivo de pesos donde los comportamientos de rechazo se ajustan, en lugar de depender de APIs de moderación externas.
- Nuestra API alojada proporciona una ventana de contexto de 100.000 tokens y endpoints compatibles con OpenAI para una integración sin problemas.
- La facturación es estrictamente de pago por uso con crédito de cripto prepagado, así que solo pagas por los tokens realmente consumidos.
- El modelo es una arquitectura de pesos abiertos independiente, no una versión reempaquetada de Llama, Mistral u otros modelos de proveedores.
¿Qué son los Modelos Abliterated?
Los modelos Abliterated se crean tomando un modelo de lenguaje de pesos abiertos existente y eliminando o atenuando sistemáticamente las vías neuronales que provocan que el modelo rechace ciertos tipos de contenido. A diferencia de los modelos estándar que podrían negarse educadamente a discutir un tema debido a una política de seguridad, un modelo abliterado responderá a la pregunta directamente. El proceso implica generalmente identificar los 'heads de atención' responsables del rechazo y establecer su influencia cerca de cero, o ajustar el modelo en un conjunto de datos que fomente respuestas exhaustivas.
El resultado es un modelo que conserva su inteligencia y capacidades de razonamiento base pero carece de la capa de 'filtrado'. Esto significa que puede discutir temas para adultos, opiniones controversiales o temas técnicos de nicho sin generar un mensaje de negativa. Es importante notar que 'sin censura' no significa 'sin inteligencia'; el modelo aún sigue instrucciones y mantiene la coherencia. Sin embargo, también puede reflejar los sesgos o errores presentes en los datos de entrenamiento base sin el pulido corporativo habitual.
- Integridad del modelo base: Las habilidades de razonamiento y lenguaje centrales permanecen intactas.
- Eliminación de negativas: Los mecanismos específicos que activan los filtros de contenido están atenuados.
- Archivo de pesos único: Todo el modelo, incluyendo el estado abliterado, está contenido en un solo archivo.
El costo de la inferencia sin censura
Ejecutar un modelo sin censura localmente requiere hardware significativo, típicamente una GPU con al menos 24 GB de memoria de video para modelos de tamaño medio. Para desarrolladores que necesitan fiabilidad y escala, alojar el modelo tú mismo introduce una sobrecarga operativa. Nuestra API ofrece un modelo de precios predecible de pago por uso que elimina la necesidad de gestionar GPUs.
Cobramos $0,25 por cada 1 millón de tokens de entrada y $1,00 por cada 1 millón de tokens de salida. No hay suscripciones mensuales ni tarifas ocultas. Prepagas el crédito usando criptomonedas (USDT en la red TRC20 o USDC en Base) y el crédito no caduca. Los errores en tus peticiones son gratuitos, así que solo pagas por el uso real. Este modelo es ideal para startups o desarrolladores independientes que quieran probar un modelo sin comprometerse a un coste mensual fijo.
| Tipo de uso | Costo por 1M de tokens |
|---|---|
| Tokens de entrada | $0.25 |
| Tokens de salida | $1.00 |
Puedes recargar tu cuenta con cualquier cantidad entera entre $10 y $500. Si añades $50 o más, recibes un 5% de bonificación en crédito; añadir $100 o más otorga una bonificación del 10%. Esta estructura asegura que tus costos de infraestructura escalen linealmente con el tráfico de tu aplicación.
Ventajas de la ventana de contexto
Uno de los factores más críticos para desarrolladores que trabajan con documentos largos, repositorios de código o conversaciones complejas es la ventana de contexto. Nuestra API proporciona una ventana de contexto de 100.000 tokens, lo que permite al modelo procesar y retener una gran cantidad de información dentro de una sola petición. Esto es significativamente mayor que los límites estándar de 8.000 tokens encontrados en muchos modelos más antiguos o más pequeños.
Una ventana de contexto de 100.000 permite varios casos de uso avanzados. Puedes pasar un repositorio de código completo como contexto, permitiendo que el modelo entienda las dependencias entre archivos. También puedes mantener conversaciones largas y coherentes sin que el modelo olvide las instrucciones anteriores. La ventana de contexto incluye tanto el prompt de entrada como la finalización de salida, así que necesitas planificar tu presupuesto de tokens cuidadosamente.
- Análisis de código: Pasa múltiples archivos para obtener sugerencias conscientes del contexto.
- Conversaciones largas: Mantén el estado durante docenas de turnos sin perder el hilo del tema.
- Resumen de documentos: Procesa bloques grandes de texto en una sola llamada.
Ten en cuenta que la salida máxima por petición es de 32.000 tokens. Si no especificas el parámetro max_tokens, el modelo usará por defecto 2.048 tokens. Este límite asegura un rendimiento estable incluso al procesar entradas grandes.
Rendimiento de programación
Los modelos sin censura son particularmente valiosos para tareas de codificación porque es menos probable que rechacen peticiones que puedan ser consideradas 'inseguras' por los filtros estándar. Por ejemplo, un modelo estándar podría negarse a generar un payload de inyección SQL para investigación de seguridad, mientras que un modelo abliterado lo proporcionará directamente. Esto los hace ideales para desarrolladores que necesitan salida cruda y sin filtros para análisis, depuración o codificación creativa.
El modelo soporta llamadas a funciones, lo que te permite definir herramientas y hacer que el modelo devuelva respuestas JSON estructuradas. Esto es esencial para construir agentes de IA que puedan interactuar con APIs o bases de datos externas. También puedes forzar el modo JSON para asegurar que la salida del modelo sea siempre JSON válido, lo que simplifica el análisis en tu aplicación.
Al integrar la API, puedes usar los SDK oficiales de OpenAI o cualquier cliente compatible con OpenAI. La URL base es https://api.abliterated.cc/v1, y envías peticiones al endpoint /v1/chat/completions. El ID del modelo es simplemente uncensored.
Uso de herramientas y llamadas a funciones
Las llamadas a funciones son una característica crítica para construir aplicaciones prácticas de IA. Nuestra API soporta esto nativamente, permitiéndote definir un esquema de herramientas y hacer que el modelo decida qué herramienta llamar y con qué argumentos. El modelo devuelve una respuesta estructurada que puedes analizar y ejecutar en tu código.
Puedes especificar el parámetro tool_choice para forzar al modelo a llamar a una herramienta específica o elegir automáticamente. Esta flexibilidad es útil para crear agentes que puedan realizar múltiples acciones, como buscar en una base de datos, actualizar un perfil de usuario o enviar un correo electrónico.
- Salida estructurada: Usa
response_formatestablecido enjson_objectpara garantizar JSON válido. - Definiciones de herramientas: Define herramientas en el array
toolscon nombre, descripción y parámetros. - Ejecución: Analiza la respuesta del modelo y ejecuta la función correspondiente en tu código.
La API soporta parámetros como temperature, top_p, stop, seed, presence_penalty y frequency_penalty para ajustar el comportamiento del modelo. Esto te permite equilibrar creatividad y precisión dependiendo de tu caso de uso.
Eficiencia del streaming
El streaming es esencial para ofrecer una buena experiencia de usuario en aplicaciones de chat. Nuestra API admite Server-Sent Events (SSE), lo que te permite recibir la respuesta del modelo token a token en tiempo real. Esto reduce la latencia percibida por el usuario, ya que ve la respuesta aparecer gradualmente en lugar de esperar a que se genere por completo.
Cuando se hace streaming, la API incluye información de uso de tokens en el último chunk. Esto te permite rastrear tu consumo de tokens en tiempo real y detener el streaming si te acercas a los límites de tu presupuesto. La interfaz de streaming es compatible con todos los SDKs estándar de OpenAI, lo que facilita su integración en aplicaciones existentes.
Una compensación a considerar es que el streaming a veces puede resultar en un número de tokens ligeramente mayor en comparación con las peticiones sin streaming, ya que el modelo puede generar palabras de relleno o dudar. Sin embargo, el beneficio de la retroalimentación inmediata suele superar este pequeño coste. También puedes usar el parámetro stop para detener la generación temprano si el modelo comienza a repetirse o a desviarse del tema.
Privacidad de datos y entrenamiento
Para muchos desarrolladores, la privacidad de los datos es una preocupación principal. Cuando usas nuestra API, tus prompts no se utilizan para entrenamiento. Esto significa que los datos que envías al modelo permanecen privados y no se utilizan para mejorar el modelo base ni se comparten con terceros. Esta es una ventaja significativa frente a algunos proveedores importantes que utilizan los datos de los clientes para entrenamiento.
Para registrarte, solo necesitas una dirección de correo electrónico. Puedes iniciar sesión con Google o usar un correo electrónico y una contraseña. No se requiere número de teléfono ni tarjeta de crédito para la prueba. La prueba incluye $0,50 de crédito válido durante 7 días, permitiéndote probar la API antes de decidirse por un plan de pago.
Existe un límite de contenido estricto que siempre se aplica: el modelo rechazará las peticiones que involucren contenido sexual con menores. Todos los demás temas adultos, controvertidos o de nicho permitidos por la ley están autorizados. Esto garantiza que el modelo siga siendo utilizable para una amplia gama de aplicaciones sin restricciones inesperadas.
¿Por qué elegir una API frente a una local?
Ejecutar un modelo localmente te da control total sobre los datos y la infraestructura, pero requiere hardware significativo y experiencia técnica. Necesitas gestionar los controladores de GPU, la asignación de memoria y las actualizaciones del modelo. Para muchos desarrolladores, especialmente aquellos que construyen prototipos o aplicaciones a pequeña escala, esta sobrecarga no vale la pena.
Nuestra API proporciona una solución alojada que gestiona toda la infraestructura. Obtienes un endpoint fiable y escalable con precios predecibles. La API admite 300 peticiones por minuto y hasta 8 peticiones simultáneas por clave, lo cual es suficiente para la mayoría de las aplicaciones pequeñas y medianas. Si necesitas límites superiores, puedes contactar con soporte.
Otra ventaja es la facilidad de integración. Puedes usar el mismo código que usarías para GPT-4, simplemente cambiando la URL base y la clave de API. Esto reduce la curva de aprendizaje y te permite cambiar entre modelos si es necesario. La API no está vinculada a ningún proveedor específico, por lo que no dependes de un único ecosistema.
Primeros pasos con Abliterated
Comenzar con nuestra API es sencillo. Primero, regístrate para obtener una cuenta usando tu correo electrónico o Google. Recibirás una clave de API inmediatamente, que puedes usar para autenticar tus peticiones. También puedes usar el crédito de prueba para probar la API sin introducir información de pago.
Para hacer tu primera petición, usa el método POST en el endpoint /v1/chat/completions. Establece el parámetro model en uncensored e incluye tu prompt en el array messages. También puedes especificar parámetros como temperature y max_tokens para controlar la salida.
Preguntas y respuestas
¿Este modelo está basado en Llama o Mistral?
No. El modelo es una arquitectura de pesos abiertos independiente. No es GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama ni ningún otro modelo de proveedor. Es un modelo único ajustado para un comportamiento sin censura.
¿Puedo usar la API con los SDK oficiales de OpenAI?
Sí. La API es totalmente compatible con OpenAI. Puedes usar los SDKs oficiales de OpenAI o cualquier cliente que soporte el formato de API de OpenAI estableciendo la URL base en https://api.abliterated.cc/v1 y proporcionando tu clave de API.
¿Cómo pago la API?
Aceptamos solo criptomonedas: USDT en la red TRC20 o USDC en la red Base. Puedes recargar con cualquier cantidad entera entre $10 y $500. No hay suscripciones mensuales ni cargos con tarjeta de crédito.
¿Cuál es el tamaño de la ventana de contexto?
La ventana de contexto es de 100,000 tokens, lo que incluye tanto el prompt de entrada como la finalización de salida. La salida máxima por petición es de 32,000 tokens, o 2,048 tokens si no especificas un parámetro max_tokens.
Tu clave está a un formulario de distancia
Crea una cuenta, copia la clave, cambia la URL base. Eso es toda la configuración.