VeilPlays
ストックにはログインが必要です
ゲームベースのベンチマークでAIモデルを比較する
Artificial Intelligence
Games
Tech
OpenAI Day
概要
VeilPlaysは、同じプロンプトで複数のAIモデルがゲームを生成し、完成品をブラインドで評価する実験的な評価プラットフォームです。モデル名を伏せ、プレイヤーの体験を重視して比較します。
特長
- 1回の生成で完結する能力を評価
- ゲーム設計・ビジュアル・創造性・コード品質を総合評価
- 実プレイヤーフィードバックを基にベンチマークを構築
学習ポイント
- カジュアルなプレイから意味のある人間評価へとつなぐ試み
- 評価プロセスの透明性と再現性を追求
備考
- ブラインド評価は名前やブランドに影響されず、公平性を高める設計。
投票数: 3