DE ▾
API-Schlüssel erhalten

LLM Hosting APILLM-Hosting: LLM-API Schnellstartanleitung

LLM-Hosting: LLM-API Schnellstartanleitung

Integriere unsere unzensierte LLM-API in Minuten, indem du die Basis-URL und den API-Schlüssel austauschst. Diese Anleitung behandelt Authentifizierung, Chat-Vervollständigungen, Streaming und Function Calling mit unserem OpenAI-kompatiblen Endpunkt.

Authentifizierung & Schlüssel

Um die LLM-Hosting-API zu nutzen, benötigst du einen API-Schlüssel aus deinem Kontodashboard. Der Schlüssel authentifiziert alle Anfragen. Bewahre ihn sicher auf; jeder mit dem Schlüssel kann dein Prepaid-Guthaben nutzen. Du kannst den Schlüssel jederzeit neu generieren, wodurch der vorherige sofort ungültig wird. Jedes Konto unterstützt einen aktiven Schlüssel. Keine Telefonnummer oder Kreditkarte ist für den Start erforderlich, da neue Konten Testguthaben erhalten.

Basis-URL-Konfiguration

Unsere API ist vollständig OpenAI-kompatibel. Um zu wechseln, aktualisiere die Basis-URL deines Clients auf https://api.llmhostingapi.com/v1 und setze deinen API-Schlüssel in den Autorisierungsheader. Dies funktioniert mit den offiziellen OpenAI-SDKs und jeder kompatiblen Client-Bibliothek. Du musst deine Code-Logik nicht ändern, nur den Endpunkt und die Anmeldeinformationen. Die zu verwendende Modell-ID ist uncensored.

curl https://api.llmhostingapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Chat-Vervollständigungs-Endpunkt

Sende Text an das Modell über POST /v1/chat/completions. Die API akzeptiert Nachrichten und gibt Textantworten zurück. Wir unterstützen ein Kontextfenster mit 100.000 Token sowohl für Input als auch Output. Function Calling wird zur strukturierten Datenextraktion unterstützt. Das Modell ist darauf abgestimmt, ohne Inhaltsablehnungen für legale erwachsene Nutzung zu antworten, was es ideal für kreative, Forschungs- oder Erwachseneninhalte ohne zusätzliche Konfiguration macht.

from openai import OpenAI

client = OpenAI(base_url="https://api.llmhostingapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Streaming-Antworten (SSE)

Für geringere Latenz und Echtzeit-Benutzererfahrungen aktiviere Streaming, indem du stream: true setzt. Die API gibt Server-Sent Events (SSE)-Chunks zurück. Dies ermöglicht es dir, teilweise Antworten anzuzeigen, während sie generiert werden. Streaming hat keinen Einfluss auf die Preise oder Token-Anzahlen. Es wird für Chat-Schnittstellen empfohlen, bei denen Benutzer sofortiges Feedback erwarten. Stelle sicher, dass dein Client die SSE-Parsing korrekt handhabt.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Unterstützung für Function Calling

Definiere Funktionen in deinem Anforderungstextkörper über den tools-Parameter. Das Modell antwortet mit Function-Calls statt mit normalem Text, wenn dies angemessen ist. Du musst die Funktion auf deiner Seite ausführen und das Ergebnis im nächsten Gesprächszug zurücksenden. Dies ermöglicht komplexe Workflows wie Datenbankabfragen oder API-Integrationen. Das Modell wählt die Tools automatisch basierend auf dem Prompt des Benutzers und den verfügbaren Funktionsdefinitionen aus.

Modell-Auflistungs-Endpunkt

Führe GET /v1/models aus, um verfügbare Modelle aufzulisten. Du siehst das uncensored-Modell mit seiner ID, dem Erstellungsdatum und dem Feld „owned by“. Dieser Endpunkt hilft, die Konnektivität und die Verfügbarkeit von Modellen zu überprüfen. Er gibt JSON im Standard OpenAI-Format zurück. Nutze dies, um Authentifizierungsprobleme zu debuggen, bevor du Chat-Anfragen sendest. Der Endpunkt ist leichtgewichtig und gibt sofort zurück.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmhostingapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Fragen und Antworten

Was sind die Ratenlimits und Fehler?

Du bist auf 300 Anfragen pro Minute pro Schlüssel begrenzt. Ein 401-Fehler bedeutet, dass dein API-Schlüssel ungültig ist. Ein 402-Fehler zeigt unzureichendes Prepaid-Guthaben an. Ein 429-Fehler bedeutet, dass du das Ratenlimit überschritten hast. Anforderungstexte sind auf 8 MB begrenzt.

Wie funktioniert die Preisgestaltung?

Die Preisgestaltung ist Pay as you go mit Prepaid-Guthaben. Input-Token kosten $0,25 pro 1M Token, Output-Token kosten $1,00 pro 1M Token. Guthaben verfällt nie. Du kannst ab $10 aufladen, mit Boni für größere Einzahlungen. Es gibt keine monatlichen Gebühren oder Abonnements.

Ist das Modell unzensiert?

Ja, das Modell antwortet ohne Ablehnungen für legale erwachsene, fiktive oder kontroverse Themen. Es blockiert keine Inhalte basierend auf politischen oder sozialen Normen. Die einzige harte Grenze ist, dass sexuell explizite Inhalte mit Minderjährigen immer blockiert werden.

Dein Schlüssel ist nur ein Formular entfernt

Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist die gesamte Einrichtung.

API-Schlüssel erhalten

API-Spezifikation

Alle echten Grenzen und Funktionen der API auf einen Blick – prüfen Sie sie, bevor Sie Guthaben kaufen.

MerkmalWert
API-FormatOpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern
EndpunktePOST /v1/chat/completions · GET /v1/models
AuthentifizierungAuthorization: Bearer YOUR_KEY
Modell-IDuncensored
Base-URLhttps://api.llmhostingapi.com/v1
Streamingja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung
Kontextfenster100.000 Tokens (Eingabe + Ausgabe)
Parametertemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Function Callingja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool
Max. Ausgabebis zum Rest des 100.000-Token-Fensters; max_tokens optional (kein separates Limit)
JSON-Modusresponse_format: {"type": "json_object"}
Parallelität8 gleichzeitige Anfragen pro Schlüssel
Ratenlimit300 Anfragen pro Minute und Schlüssel
Antwort-HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Anfragegrößebis 8 MB
Testguthaben$0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung
Gültigkeitbezahltes Guthaben verfällt nie, kein Abo
AufladenUSDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500
AbrechnungPrepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos
Preis$0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens
Bonus+5 % ab $50, +10 % ab $100
Schlüsselein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten
AnmeldungGoogle oder E-Mail und Passwort
InhalteInhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt

Fehler und Lösungen

Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.

CodeTypBedeutung
400bad_requestungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang
401missing_key · invalid_key · key_revokedSchlüssel fehlt, ist falsch oder wurde ersetzt
402no_creditkein Guthaben – aufladen, dann geht es sofort weiter
403content_blockedsexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet
404not_foundunbekannter Endpunkt
413request_too_largeAnfrage größer als 8 MB
429rate_limited · concurrencyüber 300/Min. oder 8 parallel – kurz warten
503upstream_busyModell ausgelastet – in Sekunden erneut versuchen