Lewati ke konten

Pengelola model llama.cpp

Ekstensi llama.cpp adalah ekstensi inti tersembunyi yang memungkinkan Anda mengelola model router llama.cpp lokal dari TUI. Ekstensi ini tidak tercantum di manifest ekstensi bundel, tetapi didaftarkan saat boot sebagai ekstensi bawaan.

Built-in inti

Dikirim sebagai bagian dari runtime inti Selesai; tidak tercantum di manifest ekstensi.

Permukaan runtime
Slash command

Penyiapan dan prasyarat

  • Hanya tersedia dalam mode TUI interaktif.
  • Memerlukan server yang kompatibel dengan llama.cpp yang sedang berjalan.
  • Konfigurasikan URL server dengan /login llama.cpp sebelum menggunakan /llama.
  • Pencarian dan pengunduhan Hugging Face memerlukan HF_TOKEN untuk model gated.

Yang disiapkan

  • Mendaftarkan slash command /llama dan provider llama.cpp.
  • Membaca auth provider dari model registry.
  • Memulihkan katalog model server terakhir yang berhasil antar-restart dan memperbaruinya saat server tersedia.
  • Menggunakan batas konteks yang dilaporkan server untuk kapasitas output dan mencatat penggunaan token streaming.
  • Gagal dengan anggun saat server tidak terjangkau, menawarkan retry atau close.

Yang dapat dikonfigurasi

Manajemen model llama.cpp inti dikonfigurasi melalui auth provider dan slash command. Ini adalah ekstensi bawaan tersembunyi, bukan entri manifest.

Lokasi dan preseden konfigurasi

  1. Auth provider
    /login llama.cpp
    Kredensial dan base URL disimpan melalui alur auth provider model registry.

Pengaturan

Kunci / pathTipe, default, dan nilaiDeskripsi
baseUrlstring
Default: —
URL server llama.cpp. /login menyimpan URL di provider auth env.LLAMA_BASE_URL. Saat runtime, variabel env LLAMA_BASE_URL (jika diatur) didahulukan daripada nilai yang tersimpan.
apiKey🔒string
Default: —
Kunci API opsional untuk server llama.cpp. Disimpan di provider auth; fallback ke variabel env LLAMA_API_KEY saat runtime jika tidak ada kunci tersimpan.

Variabel lingkungan

Kunci / pathDeskripsi
LLAMA_BASE_URLOverride runtime prioritas tertinggi untuk URL server llama.cpp yang dikonfigurasi. Juga digunakan sebagai default saat /login jika tidak ada URL yang dimasukkan.
LLAMA_API_KEY🔒Fallback kunci API runtime untuk server llama.cpp.
HF_TOKEN🔒Token Hugging Face untuk mencari dan mengunduh model gated.

Kontrol command, tool, dan shortcut

Kunci / pathDeskripsi
/login llama.cppKonfigurasikan base URL dan kunci API opsional untuk provider llama.cpp.
/llamaBuka pengelola model TUI. Hanya tersedia dalam mode interaktif.

Bukti source

Yang dapat dilakukan

  • Melihat daftar model yang loaded, sleeping, dan unloaded di server yang dikonfigurasi.
  • Memuat atau membongkar model.
  • Mengunduh model baru dari Hugging Face, termasuk model gated dengan HF_TOKEN.
  • Memilih kuantisasi saat model menawarkan beberapa pilihan.

Perintah, tool, dan shortcut

  • /login llama.cpp — atur base URL server dan kunci API opsional.
  • /llama — buka TUI pengelolaan model. Tidak tersedia di luar mode interaktif.
  • Auth provider adalah permukaan konfigurasi utama. LLAMA_BASE_URL menimpa base URL yang tersimpan saat runtime.

Batasan dan keamanan

  • Hanya sesi interaktif yang dapat membuka /llama.
  • Mengunduh model gated mengharuskan menerima syarat akses di Hugging Face dan HF_TOKEN yang valid di server.
  • Memuat model dapat membongkar model lain tergantung kapasitas server.
  • Kegagalan server lokal dilaporkan sebagai peringatan, bukan crash.

Source evidence

Selesai version: 0.10.0