VI ▾
Lấy khóa API

LLM Hosting APILưu trữ LLM: Hướng dẫn bắt đầu nhanh API LLM

Lưu trữ LLM: Hướng dẫn bắt đầu nhanh API LLM

Tích hợp API LLM không kiểm duyệt của chúng tôi trong vài phút bằng cách thay đổi URL cơ sở và khóa API của bạn. Hướng dẫn này bao gồm xác thực, hoàn thành hội thoại, truyền phát và gọi hàm với endpoint tương thích OpenAI của chúng tôi.

Xác thực & Khóa

Để sử dụng API llm hosting, bạn cần một khóa API từ bảng điều khiển tài khoản của bạn. Khóa này xác thực tất cả các yêu cầu. Giữ nó an toàn; bất kỳ ai có khóa này đều có thể sử dụng tín dụng trả trước của bạn. Bạn có thể tạo lại khóa bất cứ lúc nào, điều này ngay lập tức vô hiệu hóa khóa trước đó. Mỗi tài khoản hỗ trợ một khóa hoạt động. Không cần số điện thoại hoặc thẻ tín dụng để bắt đầu, vì các tài khoản mới nhận được tín dụng dùng thử miễn phí.

Cấu hình URL cơ sở

API của chúng tôi hoàn toàn tương thích với OpenAI. Để chuyển đổi, hãy cập nhật URL cơ sở của client của bạn thành https://api.llmhostingapi.com/v1 và đặt khóa API của bạn trong tiêu đề ủy quyền. Điều này hoạt động với các SDK OpenAI chính thức và bất kỳ thư viện client tương thích nào. Bạn không cần thay đổi logic mã của mình, chỉ cần endpoint và thông tin xác thực. Định danh mô hình để sử dụng là uncensored.

curl https://api.llmhostingapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Endpoint hoàn thành hội thoại

Gửi prompt đến mô hình qua POST /v1/chat/completions. API chấp nhận messages và trả về text responses. Chúng tôi hỗ trợ cửa sổ ngữ cảnh 100,000 token cho cả input và output. gọi hàm được hỗ trợ để trích xuất dữ liệu có cấu trúc. Mô hình được tinh chỉnh để trả lời mà không từ chối nội dung cho mục đích người lớn hợp pháp, giúp bạn tạo nội dung sáng tạo, nghiên cứu hoặc nội dung người lớn mà không cần cấu hình thêm.

from openai import OpenAI

client = OpenAI(base_url="https://api.llmhostingapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Phản hồi truyền phát (SSE)

Để giảm độ trễ và trải nghiệm người dùng thời gian thực, hãy bật truyền phát bằng cách đặt stream: true. API trả về các chunk Sự kiện được gửi bởi máy chủ (SSE). Điều này cho phép bạn hiển thị các phản hồi một phần khi chúng được tạo. Truyền phát không ảnh hưởng đến giá hoặc số lượng token. Nó được khuyến nghị cho các giao diện trò chuyện nơi người dùng mong đợi phản hồi ngay lập tức. Đảm bảo máy khách của bạn xử lý phân tích cú pháp SSE đúng cách.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Hỗ trợ gọi hàm

Xác định các hàm trong thân yêu cầu của bạn bằng tham số tools. Mô hình sẽ trả lời bằng các lệnh gọi hàm thay vì văn bản thuần túy khi thích hợp. Bạn phải thực hiện hàm ở phía của bạn và gửi kết quả lại trong lượt hội thoại tiếp theo. Điều này cho phép các quy trình làm việc phức tạp như truy vấn cơ sở dữ liệu hoặc tích hợp API. Mô hình xử lý việc chọn công cụ tự động dựa trên prompt của người dùng và các định nghĩa hàm có sẵn.

Endpoint liệt kê mô hình

Truy vấn GET /v1/models để liệt kê các mô hình có sẵn. Bạn sẽ thấy mô hình uncensored với ID, ngày tạo và trường chủ sở hữu của nó. Endpoint này giúp xác minh kết nối và khả dụng của mô hình. Nó trả về JSON định dạng OpenAI tiêu chuẩn. Sử dụng điều này để gỡ lỗi các vấn đề xác thực trước khi gửi các yêu cầu trò chuyện. Endpoint này nhẹ và trả về ngay lập tức.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmhostingapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Hỏi đáp

Giới hạn tốc độ và lỗi là gì?

Bạn bị giới hạn ở 300 yêu cầu mỗi phút cho mỗi khóa. Lỗi 401 có nghĩa là khóa API của bạn không hợp lệ. Lỗi 402 cho biết tín dụng trả trước không đủ. Lỗi 429 có nghĩa là bạn đã vượt quá giới hạn tốc độ. Thân yêu cầu được giới hạn ở 8 MB.

Giá cả hoạt động như thế nào?

Giá cả theo hình thức trả trước. Token đầu vào có giá $0,25 cho mỗi 1 triệu token, và token đầu ra có giá $1,00 cho mỗi 1 triệu token. Tín dụng không bao giờ hết hạn. Bạn có thể nạp tiền từ $10, với các khoản bonus cho các khoản gửi lớn. Không có phí hàng tháng hoặc đăng ký.

Mô hình có không kiểm duyệt không?

Có, mô hình trả lời mà không từ chối các chủ đề người trưởng thành hợp pháp, hư cấu hoặc gây tranh cãi. Nó không chặn nội dung dựa trên các chuẩn mực chính trị hoặc xã hội tiêu chuẩn. Giới hạn cứng duy nhất là không có nội dung tình dục liên quan đến trẻ vị thành niên, luôn bị chặn.

Khóa của bạn chỉ cách một biểu mẫu

Tạo tài khoản, sao chép khóa, thay đổi URL cơ sở. Đó là toàn bộ thiết lập.

Lấy khóa API

Thông số API

Toàn bộ giới hạn và tính năng thực tế của API ở một nơi — hãy kiểm tra trước khi nạp tiền.

MụcGiá trị
Định dạngtương thích OpenAI: mọi SDK OpenAI đều chạy được, chỉ cần đổi base URL và khóa
EndpointPOST /v1/chat/completions · GET /v1/models
Xác thựcAuthorization: Bearer YOUR_KEY
ID mô hìnhuncensored
Base URLhttps://api.llmhostingapi.com/v1
Streamingcó — server-sent events; phần cuối chứa lượng token đã dùng
Cửa sổ ngữ cảnh100.000 token (đầu vào + đầu ra)
Tham sốtemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Gọi hàmcó — tools, tool_choice; phản hồi có tool_calls, kể cả khi streaming; kết quả gửi lại bằng role: tool
Đầu ra tối đatối đa phần còn lại của cửa sổ 100.000 token; max_tokens tùy chọn (không giới hạn riêng)
Chế độ JSONresponse_format: {"type": "json_object"}
Yêu cầu đồng thờitối đa 8 cùng lúc cho mỗi khóa
Giới hạn tốc độ300 yêu cầu mỗi phút cho mỗi khóa
Header phản hồiX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Kích thước yêu cầutối đa 8 MB
Dùng thử miễn phí$0,50 trong 7 ngày, không cần thẻ · Khóa dùng thử: 2 yêu cầu song song, 60 yêu cầu/phút; hạn mức đầy đủ (8 và 300) sau lần nạp đầu
Thời hạntín dụng đã trả không hết hạn, không đăng ký định kỳ
Nạp tiềnUSDT (TRC20) hoặc USDC (Base), số tiền nguyên bất kỳ từ $10 đến $500
Tính phítín dụng trả trước theo mức dùng thực tế; lỗi và từ chối miễn phí
Giá$0,25 cho 1 triệu token đầu vào · $1,00 cho 1 triệu token đầu ra
Thưởng+5% từ $50, +10% từ $100
Khóamỗi tài khoản một khóa đang hoạt động; khóa mới thay thế khóa cũ
Đăng nhậpGoogle hoặc email và mật khẩu
Nội dungcho phép nội dung người lớn; từ chối nội dung tình dục liên quan đến trẻ vị thành niên

Mã lỗi

Lỗi trả về dạng JSON với type cố định; yêu cầu lỗi hoặc bị từ chối không bị tính phí.

MãLoạiÝ nghĩa
400bad_requestJSON sai, tin nhắn trống, tham số sai hoặc vượt cửa sổ ngữ cảnh
401missing_key · invalid_key · key_revokedthiếu khóa, sai khóa hoặc khóa đã bị thay
402no_credithết tín dụng — nạp tiền là dùng tiếp ngay
403content_blockednội dung tình dục liên quan trẻ vị thành niên — từ chối, không tính phí
404not_foundendpoint không tồn tại
413request_too_largenội dung lớn hơn 8 MB
429rate_limited · concurrencyvượt 300/phút hoặc 8 đồng thời — chờ rồi thử lại
503upstream_busymô hình đang bận — thử lại sau vài giây