FR ▾
Obtenir une clé API

LLM Hosting APIHébergement LLM : Guide de démarrage API LLM

Hébergement LLM : Guide de démarrage API LLM

Intégrez notre API LLM sans censure en quelques minutes en remplaçant votre URL de base et votre clé API. Ce guide couvre l'authentification, les complétions de chat, le streaming et l'appel de fonctions avec notre endpoint compatible OpenAI.

Authentification et clés

Pour utiliser l'API llm hosting, vous avez besoin d'une clé API depuis le tableau de bord de votre compte. La clé authentifie toutes les requêtes. Gardez-la en sécurité ; quiconque possède la clé peut utiliser votre crédit prépayé. Vous pouvez régénérer la clé à tout moment, ce qui invalide immédiatement la précédente. Chaque compte prend en charge une clé active. Aucun numéro de téléphone ni carte bancaire n'est requis pour commencer, car les nouveaux comptes reçoivent un crédit d'essai gratuit.

Configuration de l'URL de base

Notre API est entièrement compatible OpenAI. Pour basculer, mettez à jour l'URL de base de votre client vers https://api.llmhostingapi.com/v1 et définissez votre clé API dans l'en-tête d'autorisation. Cela fonctionne avec les SDK officiels OpenAI et toute bibliothèque cliente compatible. Vous n'avez pas besoin de modifier la logique de votre code, seulement l'endpoint et les identifiants. L'identifiant de modèle à utiliser est uncensored.

curl https://api.llmhostingapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Endpoint de complétion de chat

Envoyez du texte au modèle via POST /v1/chat/completions. L'API accepte des messages et renvoie des réponses textuelles. Nous prenons en charge une fenêtre de contexte de 100 000 tokens pour l'entrée et la sortie. L'appel de fonctions est pris en charge pour l'extraction de données structurées. Le modèle est ajusté pour répondre sans refus de contenu pour une utilisation adulte légale, ce qui le rend idéal pour la génération de contenu créatif, de recherche ou pour adultes sans configuration supplémentaire.

from openai import OpenAI

client = OpenAI(base_url="https://api.llmhostingapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Réponses en streaming (SSE)

Pour une latence plus faible et des expériences utilisateur en temps réel, activez le streaming en définissant stream: true. L'API renvoie des chunks d'événements envoyés par le serveur (SSE). Cela vous permet d'afficher des réponses partielles au fur et à mesure de leur génération. Le streaming n'affecte pas la tarification ni les comptes de tokens. Il est recommandé pour les interfaces de chat où les utilisateurs s'attendent à une rétroaction immédiate. Assurez-vous que votre client analyse correctement les SSE.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Support d'appel de fonctions

Définissez des fonctions dans le corps de votre requête en utilisant le paramètre tools. Le modèle répondra par des appels de fonctions au lieu de texte brut lorsque cela est approprié. Vous devez exécuter la fonction de votre côté et renvoyer le résultat dans le tour de conversation suivant. Cela permet des workflows complexes comme des requêtes de base de données ou des intégrations API. Le modèle gère la sélection des outils automatiquement en fonction du prompt de l'utilisateur et des définitions de fonctions disponibles.

Endpoint de liste des modèles

Interrogez GET /v1/models pour lister les modèles disponibles. Vous verrez le modèle uncensored avec son ID, sa date de création et le champ owned by. Cet endpoint aide à vérifier la connectivité et la disponibilité des modèles. Il renvoie du JSON au format OpenAI standard. Utilisez-le pour déboguer les problèmes d'authentification avant d'envoyer des requêtes de chat. L'endpoint est léger et renvoie immédiatement.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmhostingapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Questions et réponses

Quelles sont les limites de débit et les erreurs ?

Vous êtes limité à 300 requêtes par minute par clé. Une erreur 401 signifie que votre clé API est invalide. Une erreur 402 indique un crédit prépayé insuffisant. Une erreur 429 signifie que vous avez dépassé la limite de débit. Les corps de requête sont limités à 8 Mo.

Comment fonctionne la tarification ?

La tarification est en paiement à l'usage avec crédit prépayé. Les tokens d'entrée coûtent 0,25 $ par 1M de tokens, et les tokens de sortie coûtent 1,00 $ par 1M de tokens. Le crédit n'expire jamais. Vous pouvez recharger à partir de 10 $, avec des bonus pour les dépôts plus importants. Il n'y a pas de frais mensuels ni d'abonnements.

Le modèle est-il sans censure ?

Oui, le modèle répond sans refus pour les sujets adultes légaux, fictifs ou controversés. Il ne bloque pas le contenu en fonction des normes politiques ou sociales standard. La seule limite stricte est l'absence de contenu sexuel impliquant des mineurs, qui est toujours bloqué.

Votre clé est à un formulaire de vous

Créez un compte, copiez la clé, changez l'URL de base. C'est toute la configuration.

Obtenir une clé API

Fiche technique de l'API

Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.

ÉlémentValeur
Formatcompatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé
EndpointsPOST /v1/chat/completions · GET /v1/models
AuthentificationAuthorization: Bearer YOUR_KEY
ID du modèleuncensored
Base URLhttps://api.llmhostingapi.com/v1
Streamingoui — server-sent events ; le dernier bloc contient l'usage des tokens
Fenêtre de contexte100 000 tokens (entrée + sortie)
Paramètrestemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Appel de fonctionsoui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool
Sortie max.jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct)
Mode JSONresponse_format: {"type": "json_object"}
Concurrence8 requêtes simultanées par clé
Limite de débit300 requêtes par minute et par clé
En-têtesX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Taillejusqu'à 8 Mo par requête
Essai gratuit0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge
Validitéle crédit payé n'expire jamais, sans abonnement
RechargeUSDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $
Facturationcrédit prépayé selon l'usage réel ; erreurs et refus gratuits
Prix0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie
Bonus+5 % dès 50 $, +10 % dès 100 $
Clésune clé active par compte ; une nouvelle remplace l'ancienne
ConnexionGoogle ou e-mail et mot de passe
Contenucontenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé

Erreurs et solutions

Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.

CodeTypeSignification
400bad_requestJSON invalide, messages vides, mauvais paramètre ou contexte trop long
401missing_key · invalid_key · key_revokedclé absente, erronée ou remplacée
402no_creditplus de crédit — rechargez, la reprise est immédiate
403content_blockedcontenu sexuel impliquant des mineurs — refusé, non facturé
404not_foundendpoint inconnu
413request_too_largecorps supérieur à 8 Mo
429rate_limited · concurrencyau-delà de 300/min ou 8 en parallèle — patientez
503upstream_busymodèle occupé — réessayez dans quelques secondes