Chameleon
ストックにはログインが必要です
オンデマンドで任意のLLMを実行 — 待機中のVRAMはゼロ。
Artificial Intelligence
Developer Tools
GitHub
Open Source
概要
Chameleonは要求に応じて任意のLLMへ変身するステートレスAIランタイム。モデルを常時保持せず、各リクエストを最適なモデルへルーティングしてロード・実行・アンロードするため、アイドル時のVRAMはゼロになる。1つのランタイムで複数モデルを効率的に運用可能で、メモリの浪費や再起動を避けられる。
主な特徴
- リクエスト単位のモデル選択とルーティング
- アイドル時VRAMゼロ
- ウォームキャッシュとメモリ予算の設定
- Rust制御プレーン+Python推論バックエンド
- llama.cpp / vLLM / Transformers のプラグイン対応
利用シーンと展望
- 複数モデルを扱う環境やGPU資源が限られる状況に適している
- ローカル・クラウド双方の導入を検討可能
- 初期段階であり、フィードバック募集
投票数: 2