Dokumentasi API Integrasi Velox
< 50ms
first-token latency
99.99%
uptime SLA
vLLM
core engine
Dapatkan API Key
Pilih Model Optimized
Kirim Prompt Streaming
Daftar akun pengembang dan buat token akses aman melalui dashboard konsol Velox untuk otentikasi API inferensi instant.
Tentukan model Llama-3 atau custom weight pilihan Anda dengan format FP8 quantization untuk efisiensi memori GPU maksimal.
Eksekusi panggilan inferensi melalui HTTP endpoint streaming dengan jaminan ketersediaan latensi first-token sub-50ms tanpa delay cold-start.


Migrasi Mudah OpenAI SDK
Ganti parameter base_url ke endpoint Velox dan masukkan API key Anda. Seluruh pustaka Python dan TypeScript standar tetap berfungsi penuh tanpa perlu mengubah logika aplikasi.
Dapatkan inferensi streaming real-time berkecepatan tinggi dengan engine vLLM yang mengeliminasi cold-start dan memangkas biaya infrastruktur GPU.
Siap Integrasi Inferensi Sub-50ms
Daftar sekarang untuk mendapatkan kredit awal inferensi dan uji throughput serverless GPU pada lingkungan produksi Anda.
