PL ▾
Pobierz klucz API

LLM Hosting APIHostowanie LLM: Przewodnik szybkiego startu API LLM

Hostowanie LLM: Przewodnik szybkiego startu API LLM

Zintegruj nasz bezcenzurowany API LLM w kilka minut, zmieniając bazowy URL i klucz API. Przewodnik obejmuje uwierzytelnianie, uzupełnianie wiadomości, strumieniowanie i wywoływanie funkcji w naszym endpointzie kompatybilnym z OpenAI.

Uwierzytelnianie i klucze

Aby korzystać z API hostowania LLM, potrzebujesz klucza API z panelu konta. Klucz uwierzytelnia wszystkie zapytania. Chroń go; każdy, kto go posiada, może wykorzystać Twój przedpłacony kredyt. Możesz wygenerować klucz ponownie w dowolnym momencie, co natychmiast unieważnia poprzedni. Każde konto obsługuje jeden aktywny klucz. Nie jest wymagany numer telefonu ani karta kredytowa do rozpoczęcia, ponieważ nowe konta otrzymują darmowy kredyt próbny.

Konfiguracja bazowego URL

Nasze API jest w pełni kompatybilne z OpenAI. Aby przełączyć się, zaktualizuj bazowy URL klienta na https://api.llmhostingapi.com/v1 i ustaw swój klucz API w nagłówku autoryzacji. Działa to z oficjalnymi SDK OpenAI oraz dowolną kompatybilną biblioteką kliencką. Nie musisz zmieniać logiki kodu, tylko endpoint i dane logowania. Identyfikatorem modelu do użycia jest uncensored.

curl https://api.llmhostingapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Endpoint uzupełniania czatu

Wyślij tekst do modelu przez POST /v1/chat/completions. API akceptuje wiadomości i zwraca odpowiedzi tekstowe. Obsługujemy okno kontekstu 100 000 tokenów zarówno dla wejścia, jak i wyjścia. Wywoływanie funkcji jest obsługiwane do ekstrakcji danych strukturalnych. Model jest dostrojony do odpowiadania bez odrzucania treści dla prawnego użytku dorosłego, co czyni go idealnym do generowania treści kreatywnych, badawczych lub dla dorosłych bez dodatkowej konfiguracji.

from openai import OpenAI

client = OpenAI(base_url="https://api.llmhostingapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Odpowiedzi strumieniowe (SSE)

Aby uzyskać niższe opóźnienia i doświadczenia w czasie rzeczywistym, włącz strumieniowanie, ustawiając stream: true. API zwraca fragmenty zdarzeń wysyłanych przez serwer (SSE). Pozwala to wyświetlać częściowe odpowiedzi w miarę ich generowania. Strumieniowanie nie wpływa na ceny ani liczbę tokenów. Jest zalecane dla interfejsów czatowych, gdzie użytkownicy oczekują natychmiastowej odpowiedzi. Upewnij się, że Twój klient poprawnie parsuje SSE.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Wsparcie dla wywoływania funkcji

Zdefiniuj funkcje w treści zapytania za pomocą parametru tools. Model odpowie wywołaniami funkcji zamiast zwykłym tekstem, gdy będzie to odpowiednie. Musisz wykonać funkcję po swojej stronie i wysłać wynik z powrotem w kolejnej turze rozmowy. Umożliwia to złożone przepływy pracy, takie jak zapytania do baz danych lub integracje API. Model automatycznie wybiera narzędzia na podstawie promptu użytkownika i dostępnych definicji funkcji.

Endpoint listowania modeli

Wyślij zapytanie GET /v1/models, aby wylistować dostępne modele. Zobaczysz model uncensored z jego ID, datą utworzenia i polem właściciela. Ten endpoint pomaga zweryfikować łączność i dostępność modelu. Zwraca standardowy JSON w formacie OpenAI. Użyj go do debugowania problemów z uwierzytelnianiem przed wysłaniem zapytań czatu. Endpoint jest lekki i zwraca wynik natychmiast.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmhostingapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Pytania i odpowiedzi

Jakie są limity zapytań i jakie występują błędy?

Jesteś ograniczony do 300 zapytań na minutę na klucz. Błąd 401 oznacza, że Twój klucz API jest nieprawidłowy. Błąd 402 wskazuje na niewystarczający przedpłacony kredyt. Błąd 429 oznacza przekroczenie limitu zapytań. Treści zapytań są ograniczone do 8 MB.

Jak działa cennik?

Cennik opiera się na modelu pay-as-you-go z przedpłaconym kredytem. Tokeny wejściowe kosztują $0,25 za 1 mln tokenów, a tokeny wyjściowe $1,00 za 1 mln tokenów. Kredyt nigdy nie wygasa. Możesz doładować od $10, z bonusami za większe wpłaty. Nie ma miesięcznych opłat ani subskrypcji.

Czy model jest bez cenzury?

Tak, model odpowiada bez odmów dla legalnych tematów dla dorosłych, fikcyjnych lub kontrowersyjnych. Nie blokuje treści opartych na standardowych normach politycznych czy społecznych. Jedynym twardym limitem jest brak treści seksualnych z udziałem małoletnich, które są zawsze blokowane.

Twój klucz jest o jeden formularz stąd

Utwórz konto, skopiuj klucz, zmień bazowy URL. To cała konfiguracja.

Pobierz klucz API

Parametry API

Wszystkie rzeczywiste limity i funkcje API w jednym miejscu — sprawdź je przed doładowaniem.

ElementWartość
Format APIzgodne z OpenAI: działa każdy SDK OpenAI — zmień base URL i klucz
EndpointyPOST /v1/chat/completions · GET /v1/models
UwierzytelnianieAuthorization: Bearer YOUR_KEY
ID modeluuncensored
Base URLhttps://api.llmhostingapi.com/v1
Strumieniowanietak — server-sent events; ostatni fragment zawiera zużycie tokenów
Okno kontekstu100 000 tokenów (wejście + odpowiedź)
Parametrytemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Wywoływanie funkcjitak — tools, tool_choice; odpowiedź zawiera tool_calls, także w strumieniu; wyniki jako role: tool
Maks. odpowiedźdo reszty okna 100 000 tokenów; max_tokens opcjonalne (bez osobnego limitu)
Tryb JSONresponse_format: {"type": "json_object"}
Równoległe zapytaniado 8 jednocześnie na klucz
Limit zapytań300 zapytań na minutę na klucz
Nagłówki odpowiedziX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Rozmiar zapytaniado 8 MB
Darmowy kredyt$0,50 na 7 dni, bez karty · Klucz próbny: 2 równoległe żądania, 60 na minutę; pełne limity (8 i 300) po pierwszym doładowaniu
Ważnośćopłacony kredyt nie wygasa, bez subskrypcji
DoładowanieUSDT (TRC20) lub USDC (Base), dowolna pełna kwota od $10 do $500
Rozliczenieprzedpłacony kredyt według rzeczywistego zużycia; błędy i odmowy są darmowe
Cena$0,25 za 1 mln tokenów wejścia · $1,00 za 1 mln tokenów wyjścia
Bonus+5% od $50, +10% od $100
Kluczejeden aktywny klucz na konto; nowy zastępuje stary
LogowanieGoogle albo e-mail i hasło
Treścitreści dla dorosłych dozwolone; treści seksualne z udziałem nieletnich są odrzucane

Kody błędów

Błędy wracają jako JSON ze stałym type; nieudane i odrzucone zapytania są bezpłatne.

KodTypZnaczenie
400bad_requestbłędny JSON, puste wiadomości, zły parametr lub za długi kontekst
401missing_key · invalid_key · key_revokedbrak klucza, zły klucz lub klucz zastąpiony nowym
402no_creditbrak kredytu — doładuj, działa od razu
403content_blockedtreści seksualne z nieletnimi — odmowa, bez opłaty
404not_foundnieznany endpoint
413request_too_largetreść większa niż 8 MB
429rate_limited · concurrencyponad 300/min lub 8 równolegle — odczekaj i ponów
503upstream_busymodel zajęty — ponów za kilka sekund