VeloxQuant-MLX logo

VeloxQuant-MLX

Macで、より大規模なローカルLLMを少ないメモリで実行

Artificial Intelligence Developer Tools GitHub Open Source

概要

  • ローカルAIモデルのKVキャッシュを圧縮し、モデルの生成が進むほど増大するメモリ使用量を抑えられるオープンソースエンジンです。
  • クラウドへデータを送らず、手元のMac上でプライベートな推論環境を構築でき、Apple Silicon向けに高速な生成を目指しています。

主な特徴

  • 量子化、トークン削除、層間マージなど、研究成果に基づく43種類のKVキャッシュ圧縮手法を、統一されたシンプルなAPIから利用できます。
  • 手書きのMetalカーネルにより圧縮処理のオーバーヘッドを抑え、メモリ使用量を最大16分の1に削減しながら生成速度の維持を図ります。

こんな人におすすめ

  • Ollama、LM Studio、MLX、llama.cppなどでローカルLLMを使っており、メモリ不足やコンテキスト長の制限に悩んでいる人に適しています。
  • 医療、法律、金融、防衛など、機密データをクラウドへ送れないオフライン重視の製品やオンデバイスAIを開発するチームに向いています。
投票数: 0
← 投稿一覧に戻る