DeepSeek-V4 logo

DeepSeek-V4

高効率な100万トークンのコンテキスト・インテリジェンスへ

Artificial Intelligence

概要

DeepSeek-V4は公開MoE型LLMのプレビューシリーズ。V4-Pro(1.6T、活性化49B)とV4-Flash(284B、活性化13B)はいずれも1Mトークンの長文コンテキストに対応します。CSA+HCAのハイブリッドアテンションで長文処理の計算とKVキャッシュを削減。mHC接続とMuonオプティマイザで安定性と学習収束性を向上。32兆トークン以上で事前訓練を行い、ドメイン専門化SFT+RL(GRPO)とオンポリシー蒸留でスキルを統合しました。

投票数: 1
← 投稿一覧に戻る