ES ▾
Obtener clave de API

LLM Hosting APIAlojamiento LLM: Guía de inicio rápido de la API LLM

Alojamiento LLM: Guía de inicio rápido de la API LLM

Integra nuestra API LLM sin censura en minutos cambiando tu URL base y clave de API. Esta guía cubre autenticación, completados de chat, streaming y llamadas a funciones con nuestro endpoint compatible con OpenAI.

Autenticación y claves

Para usar la API de llm hosting, necesitas una clave de API desde el panel de tu cuenta. La clave autentica todas las peticiones. Mantén-la segura; quien la tenga puede usar tu crédito prepago. Puedes regenerarla en cualquier momento, lo que invalida la anterior. Cada cuenta admite una clave activa. No se requiere teléfono ni tarjeta de crédito; las cuentas nuevas reciben crédito de prueba gratis.

Configuración de URL base

Nuestra API es totalmente compatible con OpenAI. Para cambiar, actualiza la URL base de tu cliente a https://api.llmhostingapi.com/v1 y establece tu clave de API en el encabezado de autorización. Esto funciona con los SDK oficiales de OpenAI y cualquier biblioteca cliente compatible. No necesitas cambiar la lógica de tu código, solo el endpoint y las credenciales. El identificador de modelo a usar es uncensored.

curl https://api.llmhostingapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Endpoint de completados de chat

Envía texto al modelo mediante POST /v1/chat/completions. La API admite mensajes y devuelve respuestas de texto. Admitimos una ventana de contexto de 100.000 tokens tanto para entrada como para salida. Se admiten llamadas a funciones para la extracción de datos estructurados. El modelo está ajustado para responder sin rechazos de contenido para uso adulto lícito, lo que lo hace ideal para la generación de contenido creativo, de investigación o para adultos sin configuración adicional.

from openai import OpenAI

client = OpenAI(base_url="https://api.llmhostingapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Respuestas en streaming (SSE)

Para una menor latencia y experiencias de usuario en tiempo real, habilita el streaming estableciendo stream: true. La API devuelve fragmentos de Server-Sent Events (SSE). Esto te permite mostrar respuestas parciales a medida que se generan. El streaming no afecta los precios ni los recuentos de tokens. Se recomienda para interfaces de chat donde los usuarios esperan retroalimentación inmediata. Asegúrate de que tu cliente analice correctamente SSE.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Soporte para llamadas a funciones

Define funciones en el cuerpo de tu solicitud usando el parámetro tools. El modelo responderá con llamadas a funciones en lugar de texto plano cuando sea apropiado. Debes ejecutar la función en tu lado y enviar el resultado de vuelta en el siguiente turno de conversación. Esto habilita flujos de trabajo complejos como consultas a bases de datos o integraciones de API. El modelo maneja la selección de herramientas automáticamente según el prompt del usuario y las definiciones de funciones disponibles.

Endpoint de listado de modelos

Consulta GET /v1/models para listar modelos disponibles. Verás el modelo uncensored con su ID, fecha de creación y campo de propiedad. Este endpoint ayuda a verificar la conectividad y la disponibilidad del modelo. Devuelve JSON en formato estándar de OpenAI. Úsalo para depurar problemas de autenticación antes de enviar solicitudes de chat. El endpoint es ligero y devuelve inmediatamente.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmhostingapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Preguntas y respuestas

¿Cuáles son los límites de peticiones y los errores?

Estás limitado a 300 peticiones por minuto por clave. Un error 401 significa que tu clave de API no es válida. Un error 402 indica que tienes crédito prepago insuficiente. Un error 429 significa que has excedido el límite de peticiones. Los cuerpos de las peticiones están limitados a 8 MB.

¿Cómo funciona la facturación?

La facturación es de pago por uso con crédito prepago. Los tokens de entrada cuestan $0,25 por 1M de tokens, y los tokens de salida cuestan $1,00 por 1M de tokens. El crédito no caduca. Puedes recargar desde $10, con bonificaciones para depósitos más grandes. No hay tarifas ni suscripciones mensuales.

¿El modelo es sin censura?

Sí, el modelo responde sin rechazos para temas adultos lícitos, ficticios o controvertidos. No bloquea contenido basado en normas políticas o sociales estándar. El único límite estricto es que no hay contenido sexual que involucre a menores, lo cual siempre se bloquea.

Tu clave está a un formulario de distancia

Crea una cuenta, copia la clave y cambia la URL base. Esa es toda la configuración.

Obtener clave de API

Ficha técnica de la API

Todos los límites y funciones reales de la API en un solo lugar: revísalos antes de recargar.

ElementoValor
Formatocompatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave
EndpointsPOST /v1/chat/completions · GET /v1/models
AutenticaciónAuthorization: Bearer YOUR_KEY
ID del modelouncensored
Base URLhttps://api.llmhostingapi.com/v1
Streamingsí: server-sent events; el último fragmento incluye el uso de tokens
Ventana de contexto100.000 tokens (entrada + salida)
Parámetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Llamadas a funcionessí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool
Salida máximahasta el resto de la ventana de 100.000 tokens; max_tokens opcional (sin límite aparte)
Modo JSONresponse_format: {"type": "json_object"}
Concurrencia8 peticiones a la vez por clave
Límite de peticiones300 por minuto por clave
CabecerasX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Tamaño de peticiónhasta 8 MB
Prueba gratis$0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga
Caducidadel crédito pagado no caduca, sin suscripción
RecargaUSDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500
Facturacióncrédito prepago por uso real; errores y rechazos no se cobran
Precio$0,25 por 1M tokens de entrada · $1,00 por 1M de salida
Bono+5 % desde $50, +10 % desde $100
Clavesuna clave activa por cuenta; una nueva reemplaza a la anterior
AccesoGoogle o correo y contraseña
Contenidocontenido adulto permitido; se rechaza el contenido sexual con menores

Errores y qué hacer

Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.

CódigoTipoSignificado
400bad_requestJSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo
401missing_key · invalid_key · key_revokedfalta la clave, es incorrecta o fue reemplazada
402no_creditsin crédito: recarga y sigue al instante
403content_blockedcontenido sexual con menores: rechazado, no se cobra
404not_foundendpoint desconocido
413request_too_largecuerpo mayor de 8 MB
429rate_limited · concurrencymás de 300/min o 8 en paralelo: espera y reintenta
503upstream_busymodelo ocupado: reintenta en unos segundos