跳转到内容
主站 新闻 控制台

deepseek-ai/DeepSeek-V4-Flash-0731

· Simon Willison
技巧LLM

deepseek-ai/DeepSeek-V4-Flash-0731

DeepSeek V4 系列的最新版本,具备“显著增强的 agent 能力”。它拥有 3040 亿参数,在 Hugging Face 上占用 167GB——但看起来它的表现 远超其体量。

Artificial Analysis 将它 排名在 MiniMax M3 之前——后者是一个 4280 亿参数模型。其输入价格为每百万 token 0.14 美元、输出价格为每百万 token 0.27 美元,这意味着它目前可能是市面上性价比最高的智能模型。在 智能指数 vs. 每智能指数任务成本 图表上,它的表现看起来非常不错:

Artificial Analysis 的散点图,坐标轴分别为“Artificial Analysis Intelligence Index”(20 到 65)和“Cost per Task (USD, Log Scale)”(0.02 美元到 3 美元),左上方有一个绿色的“Most attractive quadrant”框,并有一条虚线“Pareto line”。DeepSeek V4 Flash 0731(max)以深蓝色高亮,位置大约在 0.028 美元和 50 的智能得分处,独自位于绿色象限最左侧边缘,此处 Pareto 线急剧上扬。与它智能水平相近或更低的模型,如 MiniMax-M3、Kimi K3(low)、GLM-5.1 和 Kimi K2.6,成本高出十倍;而比它更强的模型(Grok 4.5、Gemini 3.6 Flash、GLM-5.2、Kimi K3、Claude Opus 5、Claude Fable 5、GPT-5.6 Sol)都位于更右侧,每个任务成本在 0.4 到 3 美元之间。

我通过 OpenRouter 使用默认推理等级,得到了一个令人失望的鹈鹕

一幅平面矢量插画:一只白色鹈鹕,长脖子、大橙色喙囊,悬停在一辆被弄得乱七八糟的蓝橙色自行车上方,背景是深灰色道路和白色虚线车道标记。自行车画得不对:车轮只是没有轮圈和辐条的橙色弧线,车架管彼此分离悬空,车把也没有连接到任何地方。背景为浅蓝色,左上角有黄色太阳、白云,以及左侧灰色速度线,暗示运动。

但当我把推理等级调到高时,得到了好得多的结果

llm -m openrouter/deepseek/deepseek-v4-flash-0731 -t pelican -o reasoning_effort high

一幅平面矢量插画:一只白色鹈鹕骑着自行车向右行驶,背景为粉色,身后有一个更浅的粉色圆形。鹈鹕用翅膀握住车把,一只橙色脚踩在踏板上,它的大橙色喙囊角落里还露出一条小蓝鱼。自行车车架为红、蓝、橙三色,轮胎为深色,后方拖着灰色速度线以表现运动。