LLM Hosting APILLM-Hosting: LLM-API Schnellstartanleitung
LLM-Hosting: LLM-API Schnellstartanleitung
Integriere unsere unzensierte LLM-API in Minuten, indem du die Basis-URL und den API-Schlüssel austauschst. Diese Anleitung behandelt Authentifizierung, Chat-Vervollständigungen, Streaming und Function Calling mit unserem OpenAI-kompatiblen Endpunkt.
Authentifizierung & Schlüssel
Um die LLM-Hosting-API zu nutzen, benötigst du einen API-Schlüssel aus deinem Kontodashboard. Der Schlüssel authentifiziert alle Anfragen. Bewahre ihn sicher auf; jeder mit dem Schlüssel kann dein Prepaid-Guthaben nutzen. Du kannst den Schlüssel jederzeit neu generieren, wodurch der vorherige sofort ungültig wird. Jedes Konto unterstützt einen aktiven Schlüssel. Keine Telefonnummer oder Kreditkarte ist für den Start erforderlich, da neue Konten Testguthaben erhalten.
Basis-URL-Konfiguration
Unsere API ist vollständig OpenAI-kompatibel. Um zu wechseln, aktualisiere die Basis-URL deines Clients auf https://api.llmhostingapi.com/v1 und setze deinen API-Schlüssel in den Autorisierungsheader. Dies funktioniert mit den offiziellen OpenAI-SDKs und jeder kompatiblen Client-Bibliothek. Du musst deine Code-Logik nicht ändern, nur den Endpunkt und die Anmeldeinformationen. Die zu verwendende Modell-ID ist uncensored.
curl https://api.llmhostingapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Chat-Vervollständigungs-Endpunkt
Sende Text an das Modell über POST /v1/chat/completions. Die API akzeptiert Nachrichten und gibt Textantworten zurück. Wir unterstützen ein Kontextfenster mit 100.000 Token sowohl für Input als auch Output. Function Calling wird zur strukturierten Datenextraktion unterstützt. Das Modell ist darauf abgestimmt, ohne Inhaltsablehnungen für legale erwachsene Nutzung zu antworten, was es ideal für kreative, Forschungs- oder Erwachseneninhalte ohne zusätzliche Konfiguration macht.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmhostingapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Streaming-Antworten (SSE)
Für geringere Latenz und Echtzeit-Benutzererfahrungen aktiviere Streaming, indem du stream: true setzt. Die API gibt Server-Sent Events (SSE)-Chunks zurück. Dies ermöglicht es dir, teilweise Antworten anzuzeigen, während sie generiert werden. Streaming hat keinen Einfluss auf die Preise oder Token-Anzahlen. Es wird für Chat-Schnittstellen empfohlen, bei denen Benutzer sofortiges Feedback erwarten. Stelle sicher, dass dein Client die SSE-Parsing korrekt handhabt.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Unterstützung für Function Calling
Definiere Funktionen in deinem Anforderungstextkörper über den tools-Parameter. Das Modell antwortet mit Function-Calls statt mit normalem Text, wenn dies angemessen ist. Du musst die Funktion auf deiner Seite ausführen und das Ergebnis im nächsten Gesprächszug zurücksenden. Dies ermöglicht komplexe Workflows wie Datenbankabfragen oder API-Integrationen. Das Modell wählt die Tools automatisch basierend auf dem Prompt des Benutzers und den verfügbaren Funktionsdefinitionen aus.
Modell-Auflistungs-Endpunkt
Führe GET /v1/models aus, um verfügbare Modelle aufzulisten. Du siehst das uncensored-Modell mit seiner ID, dem Erstellungsdatum und dem Feld „owned by“. Dieser Endpunkt hilft, die Konnektivität und die Verfügbarkeit von Modellen zu überprüfen. Er gibt JSON im Standard OpenAI-Format zurück. Nutze dies, um Authentifizierungsprobleme zu debuggen, bevor du Chat-Anfragen sendest. Der Endpunkt ist leichtgewichtig und gibt sofort zurück.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmhostingapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Fragen und Antworten
Was sind die Ratenlimits und Fehler?
Du bist auf 300 Anfragen pro Minute pro Schlüssel begrenzt. Ein 401-Fehler bedeutet, dass dein API-Schlüssel ungültig ist. Ein 402-Fehler zeigt unzureichendes Prepaid-Guthaben an. Ein 429-Fehler bedeutet, dass du das Ratenlimit überschritten hast. Anforderungstexte sind auf 8 MB begrenzt.
Wie funktioniert die Preisgestaltung?
Die Preisgestaltung ist Pay as you go mit Prepaid-Guthaben. Input-Token kosten $0,25 pro 1M Token, Output-Token kosten $1,00 pro 1M Token. Guthaben verfällt nie. Du kannst ab $10 aufladen, mit Boni für größere Einzahlungen. Es gibt keine monatlichen Gebühren oder Abonnements.
Ist das Modell unzensiert?
Ja, das Modell antwortet ohne Ablehnungen für legale erwachsene, fiktive oder kontroverse Themen. Es blockiert keine Inhalte basierend auf politischen oder sozialen Normen. Die einzige harte Grenze ist, dass sexuell explizite Inhalte mit Minderjährigen immer blockiert werden.
Dein Schlüssel ist nur ein Formular entfernt
Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist die gesamte Einrichtung.
API-Schlüssel erhaltenAPI-Spezifikation
Alle echten Grenzen und Funktionen der API auf einen Blick – prüfen Sie sie, bevor Sie Guthaben kaufen.
| Merkmal | Wert |
|---|---|
| API-Format | OpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern |
| Endpunkte | POST /v1/chat/completions · GET /v1/models |
| Authentifizierung | Authorization: Bearer YOUR_KEY |
| Modell-ID | uncensored |
| Base-URL | https://api.llmhostingapi.com/v1 |
| Streaming | ja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung |
| Kontextfenster | 100.000 Tokens (Eingabe + Ausgabe) |
| Parameter | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Function Calling | ja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool |
| Max. Ausgabe | bis zum Rest des 100.000-Token-Fensters; max_tokens optional (kein separates Limit) |
| JSON-Modus | response_format: {"type": "json_object"} |
| Parallelität | 8 gleichzeitige Anfragen pro Schlüssel |
| Ratenlimit | 300 Anfragen pro Minute und Schlüssel |
| Antwort-Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Anfragegröße | bis 8 MB |
| Testguthaben | $0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung |
| Gültigkeit | bezahltes Guthaben verfällt nie, kein Abo |
| Aufladen | USDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500 |
| Abrechnung | Prepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos |
| Preis | $0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens |
| Bonus | +5 % ab $50, +10 % ab $100 |
| Schlüssel | ein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten |
| Anmeldung | Google oder E-Mail und Passwort |
| Inhalte | Inhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt |
Fehler und Lösungen
Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.
| Code | Typ | Bedeutung |
|---|---|---|
400 | bad_request | ungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang |
401 | missing_key · invalid_key · key_revoked | Schlüssel fehlt, ist falsch oder wurde ersetzt |
402 | no_credit | kein Guthaben – aufladen, dann geht es sofort weiter |
403 | content_blocked | sexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet |
404 | not_found | unbekannter Endpunkt |
413 | request_too_large | Anfrage größer als 8 MB |
429 | rate_limited · concurrency | über 300/Min. oder 8 parallel – kurz warten |
503 | upstream_busy | Modell ausgelastet – in Sekunden erneut versuchen |