Chameleon logo

Chameleon

オンデマンドで任意のLLMを実行 — 待機中のVRAMはゼロ。

Artificial Intelligence Developer Tools GitHub Open Source

概要

Chameleonは要求に応じて任意のLLMへ変身するステートレスAIランタイム。モデルを常時保持せず、各リクエストを最適なモデルへルーティングしてロード・実行・アンロードするため、アイドル時のVRAMはゼロになる。1つのランタイムで複数モデルを効率的に運用可能で、メモリの浪費や再起動を避けられる。

主な特徴

  • リクエスト単位のモデル選択とルーティング
  • アイドル時VRAMゼロ
  • ウォームキャッシュとメモリ予算の設定
  • Rust制御プレーン+Python推論バックエンド
  • llama.cpp / vLLM / Transformers のプラグイン対応

利用シーンと展望

  • 複数モデルを扱う環境やGPU資源が限られる状況に適している
  • ローカル・クラウド双方の導入を検討可能
  • 初期段階であり、フィードバック募集
投票数: 2
← 投稿一覧に戻る