Layer-Streaming Telemetry Harness logo

Layer-Streaming Telemetry Harness

厳格な0GB VRAM制限下で巨大なMoE LLMをベンチマークする

Artificial Intelligence Developer Tools GitHub Open Source

概要

  • MITライセンスのオープンソース診断ツール。標準の事務用ハードウェア上で frontier級モデルを動作させる際の物理的制約を測定します。
  • 主な測定項目はピークRAM、アクティブVRAM割り当て、データ転送層の実行状況。
  • 284BパラメータMoEモデルをFP4/FP8量子化で評価し、メモリリークとOSディスクのボトルネックの発生箇所を追跡。
  • 参考として、コアシステムエンジニアリングの解説へリンクが提供されています。

主要データポイント

  • アクティブGPU VRAM: 0.00 GB(ローカルグラフィックス割り当てなしで実行可能)
  • ホストRAMのピーク: 19.28 GB

今後の活用ポイント

  • ハードウェア非依存のアーキテクチャ監査の補助
  • 設計検討の出発点としてのメモリとデータ転送のボトルネック理解
  • コードベースにはトラッキングループやトークナイザーラッパー、指標自動集計が含まれる
投票数: 2
← 投稿一覧に戻る