LLM Hosting APIHébergement LLM : Guide de démarrage API LLM
Hébergement LLM : Guide de démarrage API LLM
Intégrez notre API LLM sans censure en quelques minutes en remplaçant votre URL de base et votre clé API. Ce guide couvre l'authentification, les complétions de chat, le streaming et l'appel de fonctions avec notre endpoint compatible OpenAI.
Authentification et clés
Pour utiliser l'API llm hosting, vous avez besoin d'une clé API depuis le tableau de bord de votre compte. La clé authentifie toutes les requêtes. Gardez-la en sécurité ; quiconque possède la clé peut utiliser votre crédit prépayé. Vous pouvez régénérer la clé à tout moment, ce qui invalide immédiatement la précédente. Chaque compte prend en charge une clé active. Aucun numéro de téléphone ni carte bancaire n'est requis pour commencer, car les nouveaux comptes reçoivent un crédit d'essai gratuit.
Configuration de l'URL de base
Notre API est entièrement compatible OpenAI. Pour basculer, mettez à jour l'URL de base de votre client vers https://api.llmhostingapi.com/v1 et définissez votre clé API dans l'en-tête d'autorisation. Cela fonctionne avec les SDK officiels OpenAI et toute bibliothèque cliente compatible. Vous n'avez pas besoin de modifier la logique de votre code, seulement l'endpoint et les identifiants. L'identifiant de modèle à utiliser est uncensored.
curl https://api.llmhostingapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Endpoint de complétion de chat
Envoyez du texte au modèle via POST /v1/chat/completions. L'API accepte des messages et renvoie des réponses textuelles. Nous prenons en charge une fenêtre de contexte de 100 000 tokens pour l'entrée et la sortie. L'appel de fonctions est pris en charge pour l'extraction de données structurées. Le modèle est ajusté pour répondre sans refus de contenu pour une utilisation adulte légale, ce qui le rend idéal pour la génération de contenu créatif, de recherche ou pour adultes sans configuration supplémentaire.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmhostingapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Réponses en streaming (SSE)
Pour une latence plus faible et des expériences utilisateur en temps réel, activez le streaming en définissant stream: true. L'API renvoie des chunks d'événements envoyés par le serveur (SSE). Cela vous permet d'afficher des réponses partielles au fur et à mesure de leur génération. Le streaming n'affecte pas la tarification ni les comptes de tokens. Il est recommandé pour les interfaces de chat où les utilisateurs s'attendent à une rétroaction immédiate. Assurez-vous que votre client analyse correctement les SSE.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Support d'appel de fonctions
Définissez des fonctions dans le corps de votre requête en utilisant le paramètre tools. Le modèle répondra par des appels de fonctions au lieu de texte brut lorsque cela est approprié. Vous devez exécuter la fonction de votre côté et renvoyer le résultat dans le tour de conversation suivant. Cela permet des workflows complexes comme des requêtes de base de données ou des intégrations API. Le modèle gère la sélection des outils automatiquement en fonction du prompt de l'utilisateur et des définitions de fonctions disponibles.
Endpoint de liste des modèles
Interrogez GET /v1/models pour lister les modèles disponibles. Vous verrez le modèle uncensored avec son ID, sa date de création et le champ owned by. Cet endpoint aide à vérifier la connectivité et la disponibilité des modèles. Il renvoie du JSON au format OpenAI standard. Utilisez-le pour déboguer les problèmes d'authentification avant d'envoyer des requêtes de chat. L'endpoint est léger et renvoie immédiatement.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmhostingapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Questions et réponses
Quelles sont les limites de débit et les erreurs ?
Vous êtes limité à 300 requêtes par minute par clé. Une erreur 401 signifie que votre clé API est invalide. Une erreur 402 indique un crédit prépayé insuffisant. Une erreur 429 signifie que vous avez dépassé la limite de débit. Les corps de requête sont limités à 8 Mo.
Comment fonctionne la tarification ?
La tarification est en paiement à l'usage avec crédit prépayé. Les tokens d'entrée coûtent 0,25 $ par 1M de tokens, et les tokens de sortie coûtent 1,00 $ par 1M de tokens. Le crédit n'expire jamais. Vous pouvez recharger à partir de 10 $, avec des bonus pour les dépôts plus importants. Il n'y a pas de frais mensuels ni d'abonnements.
Le modèle est-il sans censure ?
Oui, le modèle répond sans refus pour les sujets adultes légaux, fictifs ou controversés. Il ne bloque pas le contenu en fonction des normes politiques ou sociales standard. La seule limite stricte est l'absence de contenu sexuel impliquant des mineurs, qui est toujours bloqué.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, changez l'URL de base. C'est toute la configuration.
Obtenir une clé APIFiche technique de l'API
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Authentification | Authorization: Bearer YOUR_KEY |
| ID du modèle | uncensored |
| Base URL | https://api.llmhostingapi.com/v1 |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Fenêtre de contexte | 100 000 tokens (entrée + sortie) |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Sortie max. | jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Mode JSON | response_format: {"type": "json_object"} |
| Concurrence | 8 requêtes simultanées par clé |
| Limite de débit | 300 requêtes par minute et par clé |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Taille | jusqu'à 8 Mo par requête |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
| Connexion | Google ou e-mail et mot de passe |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
Erreurs et solutions
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |