Integrasi Cepat

Dokumentasi API Integrasi Velox

Panduan lengkap dan terstruktur untuk menghubungkan endpoint inferensi LLM ultra-cepat berlatensi sub-50ms langsung ke aplikasi produksi Anda.

< 50ms

first-token latency

99.99%

uptime SLA

vLLM

core engine

Alur Integrasi

Tiga Langkah Integrasi Cepat

01
02
03

Dapatkan API Key

Pilih Model Optimized

Kirim Prompt Streaming

Daftar akun pengembang dan buat token akses aman melalui dashboard konsol Velox untuk otentikasi API inferensi instant.

Tentukan model Llama-3 atau custom weight pilihan Anda dengan format FP8 quantization untuk efisiensi memori GPU maksimal.

Eksekusi panggilan inferensi melalui HTTP endpoint streaming dengan jaminan ketersediaan latensi first-token sub-50ms tanpa delay cold-start.

Kompatibilitas SDK

Migrasi Mudah OpenAI SDK

Ganti parameter base_url ke endpoint Velox dan masukkan API key Anda. Seluruh pustaka Python dan TypeScript standar tetap berfungsi penuh tanpa perlu mengubah logika aplikasi.

Dapatkan inferensi streaming real-time berkecepatan tinggi dengan engine vLLM yang mengeliminasi cold-start dan memangkas biaya infrastruktur GPU.

Siap Integrasi Inferensi Sub-50ms

Daftar sekarang untuk mendapatkan kredit awal inferensi dan uji throughput serverless GPU pada lingkungan produksi Anda.