LLM Hosting APIAlojamiento LLM: Guía de inicio rápido de la API LLM
Alojamiento LLM: Guía de inicio rápido de la API LLM
Integra nuestra API LLM sin censura en minutos cambiando tu URL base y clave de API. Esta guía cubre autenticación, completados de chat, streaming y llamadas a funciones con nuestro endpoint compatible con OpenAI.
Autenticación y claves
Para usar la API de llm hosting, necesitas una clave de API desde el panel de tu cuenta. La clave autentica todas las peticiones. Mantén-la segura; quien la tenga puede usar tu crédito prepago. Puedes regenerarla en cualquier momento, lo que invalida la anterior. Cada cuenta admite una clave activa. No se requiere teléfono ni tarjeta de crédito; las cuentas nuevas reciben crédito de prueba gratis.
Configuración de URL base
Nuestra API es totalmente compatible con OpenAI. Para cambiar, actualiza la URL base de tu cliente a https://api.llmhostingapi.com/v1 y establece tu clave de API en el encabezado de autorización. Esto funciona con los SDK oficiales de OpenAI y cualquier biblioteca cliente compatible. No necesitas cambiar la lógica de tu código, solo el endpoint y las credenciales. El identificador de modelo a usar es uncensored.
curl https://api.llmhostingapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Endpoint de completados de chat
Envía texto al modelo mediante POST /v1/chat/completions. La API admite mensajes y devuelve respuestas de texto. Admitimos una ventana de contexto de 100.000 tokens tanto para entrada como para salida. Se admiten llamadas a funciones para la extracción de datos estructurados. El modelo está ajustado para responder sin rechazos de contenido para uso adulto lícito, lo que lo hace ideal para la generación de contenido creativo, de investigación o para adultos sin configuración adicional.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmhostingapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Respuestas en streaming (SSE)
Para una menor latencia y experiencias de usuario en tiempo real, habilita el streaming estableciendo stream: true. La API devuelve fragmentos de Server-Sent Events (SSE). Esto te permite mostrar respuestas parciales a medida que se generan. El streaming no afecta los precios ni los recuentos de tokens. Se recomienda para interfaces de chat donde los usuarios esperan retroalimentación inmediata. Asegúrate de que tu cliente analice correctamente SSE.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Soporte para llamadas a funciones
Define funciones en el cuerpo de tu solicitud usando el parámetro tools. El modelo responderá con llamadas a funciones en lugar de texto plano cuando sea apropiado. Debes ejecutar la función en tu lado y enviar el resultado de vuelta en el siguiente turno de conversación. Esto habilita flujos de trabajo complejos como consultas a bases de datos o integraciones de API. El modelo maneja la selección de herramientas automáticamente según el prompt del usuario y las definiciones de funciones disponibles.
Endpoint de listado de modelos
Consulta GET /v1/models para listar modelos disponibles. Verás el modelo uncensored con su ID, fecha de creación y campo de propiedad. Este endpoint ayuda a verificar la conectividad y la disponibilidad del modelo. Devuelve JSON en formato estándar de OpenAI. Úsalo para depurar problemas de autenticación antes de enviar solicitudes de chat. El endpoint es ligero y devuelve inmediatamente.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmhostingapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Preguntas y respuestas
¿Cuáles son los límites de peticiones y los errores?
Estás limitado a 300 peticiones por minuto por clave. Un error 401 significa que tu clave de API no es válida. Un error 402 indica que tienes crédito prepago insuficiente. Un error 429 significa que has excedido el límite de peticiones. Los cuerpos de las peticiones están limitados a 8 MB.
¿Cómo funciona la facturación?
La facturación es de pago por uso con crédito prepago. Los tokens de entrada cuestan $0,25 por 1M de tokens, y los tokens de salida cuestan $1,00 por 1M de tokens. El crédito no caduca. Puedes recargar desde $10, con bonificaciones para depósitos más grandes. No hay tarifas ni suscripciones mensuales.
¿El modelo es sin censura?
Sí, el modelo responde sin rechazos para temas adultos lícitos, ficticios o controvertidos. No bloquea contenido basado en normas políticas o sociales estándar. El único límite estricto es que no hay contenido sexual que involucre a menores, lo cual siempre se bloquea.
Tu clave está a un formulario de distancia
Crea una cuenta, copia la clave y cambia la URL base. Esa es toda la configuración.
Obtener clave de APIFicha técnica de la API
Todos los límites y funciones reales de la API en un solo lugar: revísalos antes de recargar.
| Elemento | Valor |
|---|---|
| Formato | compatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Autenticación | Authorization: Bearer YOUR_KEY |
| ID del modelo | uncensored |
| Base URL | https://api.llmhostingapi.com/v1 |
| Streaming | sí: server-sent events; el último fragmento incluye el uso de tokens |
| Ventana de contexto | 100.000 tokens (entrada + salida) |
| Parámetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Llamadas a funciones | sí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool |
| Salida máxima | hasta el resto de la ventana de 100.000 tokens; max_tokens opcional (sin límite aparte) |
| Modo JSON | response_format: {"type": "json_object"} |
| Concurrencia | 8 peticiones a la vez por clave |
| Límite de peticiones | 300 por minuto por clave |
| Cabeceras | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Tamaño de petición | hasta 8 MB |
| Prueba gratis | $0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga |
| Caducidad | el crédito pagado no caduca, sin suscripción |
| Recarga | USDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500 |
| Facturación | crédito prepago por uso real; errores y rechazos no se cobran |
| Precio | $0,25 por 1M tokens de entrada · $1,00 por 1M de salida |
| Bono | +5 % desde $50, +10 % desde $100 |
| Claves | una clave activa por cuenta; una nueva reemplaza a la anterior |
| Acceso | Google o correo y contraseña |
| Contenido | contenido adulto permitido; se rechaza el contenido sexual con menores |
Errores y qué hacer
Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo |
401 | missing_key · invalid_key · key_revoked | falta la clave, es incorrecta o fue reemplazada |
402 | no_credit | sin crédito: recarga y sigue al instante |
403 | content_blocked | contenido sexual con menores: rechazado, no se cobra |
404 | not_found | endpoint desconocido |
413 | request_too_large | cuerpo mayor de 8 MB |
429 | rate_limited · concurrency | más de 300/min o 8 en paralelo: espera y reintenta |
503 | upstream_busy | modelo ocupado: reintenta en unos segundos |