DeepSeek V4.1 Flash: 新しいバージョンは写真を認識し、V4 Pro をバイパスします。
DeepSeek は、V4.1 Flash をリリースしました。これは、通常の V4 Flash と画像認識を備えた実験版の 2 つの以前のモデルを一度に置き換えたモデルです。これは、コードの作成と画像の解析の両方を行う 1 つのモデルです。エージェントのベンチマークによると、V4 Pro をバイパスし、100 万のトークンのコンテキストを保持し、約 4 分の 1 のキャッシュを消費します。 NeuralSpace V4.1 Flash では、チャット、「コード」セクション、および API ですでに利用可能です - V4 Flash と比較して何が変わったのか見てみましょう。
どのモデル
正式には、これは以前の Flash のリビジョンではなく、新しいアーキテクチャ ファミリの最初のモデルです。うV4.1 Flash 5,520 億のパラメータ V4 Flash の 2,840 億に対し、モデルは著しく大きくなります。ただし、各ステップでアクティブなパラメータの数は少なくなります。 入力読み取り時は80億 応答を生成する場合は 160 億。
新しいスキームは Causal Encoder-Decoder と呼ばれます。40 のトランスフォーマー層は 20 のエンコーダー層と 20 のデコーダー層に分割され、キーと値の一般的なキャッシュはエンコーダーの隠れた状態から一度構築され、各層で再度再計算されることはありません。これが、モデルが入力を安価に処理する理由です。この非対称性は偶然に選択されたわけではありません。エージェントはファイル、対話履歴、指示などを大量に読み取り、編集、コマンド、決定などを比較的少量しか書き込みません。高価な部分が簡単になったため、エージェントの作業が安くなりました。
コンテキスト - 100 万個のトークン。推論の労力は 1 から 100 まで連続的に調整できます。単純な質問は低コストで実行でき、複雑なチェーンはモデルを変更せずに最大限に実行できます。
今、彼は写真を見ています
以前のバージョンとの最も顕著な違い。 V4 Flash はテキスト入力しかできませんでした。彼女は画像の見方を知りませんでした。このため、DeepSeek は実験的な視覚モデルを別途リリースしました。 V4.1 Flash では、ビジョンがモデル自体に組み込まれており、テキストと画像をネイティブに受け入れ、テキストで応答します。
実際には、これは、インターフェイスのスクリーンショット、グラフ、写真、またはドキュメントのページをそのままモデルに与えることができることを意味します。彼女は画像を説明し、スクリーンショットからテキストを抽出し、図を分析します。これはエージェントにとって特に便利です。1 つのモデルでコードとインターフェイスのスクリーンショットの両方を読み取ることができるため、2 つのサービスを切り替える必要がありません。
古いモデル名 DeepSeek は廃止されました。 v4-flash および v4-flash-vision-exp へのリクエストは V4.1 Flash にリダイレクトされます。古い統合は何も認識しません。

バイパスされました V4 Pro
このリリースの最大のハイライトは、エージェント タスクにおいて、V4.1 Flash が規模の大きい V4 Pro を上回ったことです。公式測定値 DeepSeek の数値は次のとおりです。
- Terminal-Bench 2.1 (ターミナルでの作業) - 90.6 対 V4 Pro では 87.9、前の V4 Flash では 82.7。
- CyberGym (サイバーセキュリティ) - V4 Pro では 88.1 対 83.3;
- DeepSWE v1.1 — 74.2 対 V4 Flash の 54.4。
- Terminal-Bench 4.0 — V4 Flash では 31.2 対 7.0。
これに対して、GPQA Diamondでは90.9、Codeforcesでは3471、MathArena Apexでは65.6となっています。この数字は独立したものではなく、DeepSeek 自身によって与えられたものであるため、判決ではなく声明として扱われるべきです。しかし、以前の Flash でのジャンプの規模は、サードパーティの測定がなくても目に見えます。
次に、DeepSeek は、V4 Pro を段階的に廃止すると発表しました。9 月 14 日から、その API はリクエストを V4 Pro から V4.1 Flash にリダイレクトし、Flash レートでカウントします。実際的な結論は単純です。Flash はもはや「ジュニア」モデルではありません。現在、主な負荷を担っているのは彼女であり、通常バージョンとビジョンバージョンは別々に存在しなくなりました。
キャッシュが少ないとエージェントのタスクが安くなる
エージェントベースのシナリオの場合、主な節約はトークン価格ではなくキャッシュにあります。エージェントは対話履歴、指示、プロジェクト ファイルを何度も繰り返し読み取りますが、請求額の大部分を占めるのはキャッシュされた入力です。 V4.1 Flash グローバル KV キャッシュには約 トークンごとに 890 バイト - V4 Flash より約 4 倍小さく、キャッシュの永続部分は約 8 倍圧縮されます。
モデル自体の価格も以前のフラッシュと比較して下がりました。キャッシュされた入力は 60%、通常の入力は約 3 分の 1、出力は 11% 安くなりました。この効果は、大規模なコンテキストを何度も再利用するタスクで特に顕著です。新しい回答の長さがより重要な場合、節約はより控えめになります。

V4 Flash と V4.1 Flash: 何が変わったのか
| パラメータ | V4 Flash | V4.1 Flash |
|---|---|---|
| オプション | 2,840億 | 5,520億 |
| ステップでアクティブ | 130億 | 80億インプット / 160億アウトプット |
| 建築 | MoE-デコーダー | Causal Encoder-Decoder |
| 絵を理解する | いいえ、別のビジョンモデルです | はい、ネイティブです |
| コンテクスト | 100万トークン | 100万トークン |
| Terminal-Bench 2.1 | 82,7 | 90,6 |
| DeepSWE v1.1 | 54,4 | 74,2 |
| トークンあたりKV-現金 | ~4倍以上 | 890バイト |
価格NeuralSpaceと試し方
NeuralSpace モデルは、以前の V4 Flash と同じ速度で動作します。 100 万入力トークンあたり 0.14 ドル そして 週末 100 万件あたり 0.28 ドル。開始 - 残高上のトークン 3 個から。別のサブスクリプションや外国のカードを必要とせず、一般残高から引き落とされます。試してみるには、次の 1 つのステップだけで十分です。
- チャット: モデルページ — ここに写真やスクリーンショットを添付すると、モデルがそれらを分類します。
- コード: 「コード」セクション — モデルはプロジェクトに接続し、リポジトリ、ファイル、ターミナルと連携します。
- API: キーはセクションで発行されます API-キー、OpenAIと互換性のある形式。ドキュメント - neuralspace.pro/ja/v1/docs.
よくある質問
V4.1 Flash - これは新しいモデルですか、それともアップデートですか? これは新しいアーキテクチャ ファミリのバージョンであり、以前の Flash のリビジョンではありません。アーキテクチャが変更され、サポート部分が拡張され、ビジョンが現れました。
彼女は写真を見ますか? はい、ネイティブで: 写真、スクリーンショット、グラフ、またはドキュメントを送信できます。最後のV4 Flashはテキストでした。
V4 Proはどうなったのですか? DeepSeek は段階的に廃止され、リクエストを V4.1 Flash にリダイレクトしています。これは、エージェントベースのベンチマークで V4 Pro を上回っています。
試してみるのにいくらかかりますか? 残高3トークンから開始、100万トークンあたり0.14ドル/0.28ドル モデルのチャットページ.
v4-flash への古いリクエストは壊れますか? いいえ: v4-flash と v4-flash-vision-exp への通話は V4.1 Flash にリダイレクトされ、そのレートでカウントされます。