LLM Hosting APIHosting LLM: Guida rapida API LLM
Hosting LLM: Guida rapida API LLM
Integra la nostra API LLM senza censura in pochi minuti modificando l'URL di base e la chiave API. Questa guida copre autenticazione, chat, streaming e chiamata di funzioni con il nostro endpoint compatibile con OpenAI.
Autenticazione e Chiavi
Per utilizzare l'API di hosting LLM, hai bisogno di una chiave API dal cruscotto del tuo account. La chiave autentica tutte le richieste. Tienila al sicuro; chiunque abbia la chiave può utilizzare il tuo credito prepagato. Puoi rigenerare la chiave in qualsiasi momento, invalidando immediatamente quella precedente. Ogni account supporta una chiave attiva. Non è necessario un numero di telefono o una carta di credito per iniziare, poiché i nuovi account ricevono credito di prova gratuito.
Configurazione URL di Base
La nostra API è completamente compatibile con OpenAI. Per cambiare, aggiorna l'URL di base del tuo client a https://api.llmhostingapi.com/v1 e imposta la tua chiave API nell'intestazione di autorizzazione. Funziona con gli SDK ufficiali OpenAI e qualsiasi libreria client compatibile. Non è necessario modificare la logica del codice, solo l'endpoint e le credenziali. L'identificatore del modello da usare è uncensored.
curl https://api.llmhostingapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Endpoint Completamenti Chat
Invia testo al modello tramite POST /v1/chat/completions. L'API accetta messaggi e restituisce risposte testuali. Supportiamo una finestra di contesto di 100.000 token sia per input che per output. La chiamata di funzioni è supportata per l'estrazione di dati strutturati. Il modello è ottimizzato per rispondere senza rifiuti di contenuto per uso adulto lecito, rendendolo ideale per la generazione di contenuti creativi, di ricerca o per adulti senza configurazione aggiuntiva.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmhostingapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Risposte in Streaming (SSE)
Per una latenza inferiore e esperienze utente in tempo reale, abilita lo streaming impostando stream: true. L'API restituisce chunk di Server-Sent Events (SSE). Questo ti permette di visualizzare le risposte parziali mentre vengono generate. Lo streaming non influisce sui prezzi o sui conteggi dei token. È consigliato per le interfacce chat dove gli utenti si aspettano feedback immediato. Assicurati che il tuo client gestisca correttamente il parsing SSE.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Supporto Chiamata di Funzioni
Definisci le funzioni nel corpo della richiesta usando il parametro tools. Il modello risponderà con chiamate di funzioni invece che testo normale quando appropriato. Devi eseguire la funzione dal tuo lato e inviare il risultato nel turno di conversazione successivo. Questo abilita flussi di lavoro complessi come query al database o integrazioni API. Il modello gestisce automaticamente la selezione degli strumenti in base al prompt dell'utente e alle definizioni delle funzioni disponibili.
Endpoint Elenco Modelli
Interroga GET /v1/models per elencare i modelli disponibili. Vedrai il modello uncensored con il suo ID, data di creazione e campo proprietario. Questo endpoint aiuta a verificare la connettività e la disponibilità del modello. Restituisce JSON in formato OpenAI standard. Usalo per debuggare problemi di autenticazione prima di inviare richieste di chat. L'endpoint è leggero e restituisce immediatamente.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmhostingapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Domande e risposte
Quali sono i limiti di richiesta e gli errori?
Il limite è di 300 richieste al minuto per chiave. Un errore 401 indica una chiave API non valida. Un errore 402 segnala credito prepagato insufficiente. Un errore 429 indica che hai superato il limite di richieste. I corpi delle richieste sono limitati a 8 MB.
Come funziona la tariffazione?
La tariffazione è a consumo con credito prepagato. I token di input costano $0,25 per 1M token, quelli di output $1,00 per 1M token. Il credito non scade mai. Puoi ricaricare a partire da $10, con bonus per depositi maggiori. Non ci sono canoni o abbonamenti mensili.
Il modello è senza censura?
Sì, il modello risponde senza rifiuti per argomenti adulti leciti, di fantasia o controversi. Non blocca i contenuti in base alle norme politiche o sociali standard. L'unico limite rigido è l'assenza di contenuti sessuali che coinvolgono minori, sempre bloccati.
La tua chiave è a un modulo di distanza
Crea un account, copia la chiave, cambia l'URL di base. È tutta qui la configurazione.
Ottieni la chiave APIScheda tecnica dell'API
Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.
| Voce | Valore |
|---|---|
| Formato | compatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave |
| Endpoint | POST /v1/chat/completions · GET /v1/models |
| Autenticazione | Authorization: Bearer YOUR_KEY |
| ID modello | uncensored |
| Base URL | https://api.llmhostingapi.com/v1 |
| Streaming | sì — server-sent events; l'ultimo blocco riporta l'uso dei token |
| Finestra di contesto | 100.000 token (input + output) |
| Parametri | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Function calling | sì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool |
| Output massimo | fino al resto della finestra di 100.000 token; max_tokens opzionale (nessun limite separato) |
| Modalità JSON | response_format: {"type": "json_object"} |
| Concorrenza | 8 richieste contemporanee per chiave |
| Limite di frequenza | 300 richieste al minuto per chiave |
| Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Dimensione | fino a 8 MB per richiesta |
| Prova gratuita | $0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica |
| Scadenza | il credito pagato non scade, nessun abbonamento |
| Ricarica | USDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500 |
| Fatturazione | credito prepagato in base all'uso reale; errori e rifiuti gratuiti |
| Prezzo | $0,25 per 1M token in input · $1,00 per 1M in output |
| Bonus | +5% da $50, +10% da $100 |
| Chiavi | una chiave attiva per account; una nuova sostituisce la precedente |
| Accesso | Google oppure e-mail e password |
| Contenuti | contenuti per adulti consentiti; rifiutati i contenuti sessuali con minori |
Codici di errore
Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.
| Codice | Tipo | Significato |
|---|---|---|
400 | bad_request | JSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo |
401 | missing_key · invalid_key · key_revoked | chiave mancante, errata o sostituita |
402 | no_credit | credito esaurito — ricarica e riparti subito |
403 | content_blocked | contenuti sessuali con minori — rifiutato, non addebitato |
404 | not_found | endpoint sconosciuto |
413 | request_too_large | corpo oltre 8 MB |
429 | rate_limited · concurrency | oltre 300/min o 8 in parallelo — attendi e riprova |
503 | upstream_busy | modello occupato — riprova tra pochi secondi |