Autotune
ストックにはログインが必要です
デバイス上でローカルのLLMをより速く、快適に動作させる
Artificial Intelligence
Developer Tools
Tech
AutotuneはローカルLLM用のオープンソースのランタイム最適化ツール。KVキャッシュのメモリ削減、最初のトークン遅延の改善、推論設定のハードウェアとワークロードへの動的適応を実現します。Ollama、MLX、OpenAI互換APIと組み合わせて使えます。ベンチマークでは最初のトークンまでの時間を39%、エージェント系ワークフローの総実行時間を46%、KVキャッシュの使用量を67%低減できることが示されています。主な機能にはOpenAI互換のローカルAPI、組み込みCLI、RAM管理、モデル推奨などが含まれます。
投票数: 15