V41 FlashLab INDEPENDENT MODEL EVAL 模型页面
公开页面快照

DeepSeek
V4.1 Flash 迁移体检

用最多 50 条脱敏业务样本,把当前模型与 V4.1-Flash 放进同一套规则, 材料齐备后 3 个工作日交付质量、延迟、token 用量、成本估算和迁移边界判断。

官方披露 待独立验证 独立复现
公开配置图 结构示意,不代表性能结论 CONFIG ↗
TEXT IMAGE
552B BACKBONE 40 层文本主干
384 路由专家 6 每 token 选用 32 层视觉编码器
OUTPUT 文本生成

技术报告另列 196B Engram,并称激活参数约为预填充 8B / 解码 16B;质量、速度与资源占用仍需实测。

技术报告 552B backbone · 8B prefill / 16B decode active
CONFIG 1,048,576 位置配置;参考实现默认 4K,交互模式 64K
CONFIG FP8 + FP4 FP8 量化,专家权重 FP4
MODEL CARD MIT 仓库许可证标记
API

官方 API 已上线,model id 为 deepseek-flash;仓库 README 标题仍写作 DeepSeek-V4.1-Exp。评测报告必须同时记录端点、model id 与权重 revision。

API 与价格 ↗

BUYER OUTCOMES / 交付结果

交付的不是总分,而是迁移决策

同一模型在不同端点、参数和业务数据上会得出不同答案。评估必须落到你的工作负载。

01 DECISION

回答是否值得迁移

迁移、部分路由或暂缓

按业务门槛分别判断质量、可靠性、延迟、token 用量与成本估算,不用一个综合分掩盖硬性失败。

结论
按任务给出迁移建议
门槛
由业务负责人预先确认
02 EVIDENCE

说明为什么得出结论

逐样本证据与失败分类

保留输入、完整输出、逐次运行、错误、评分和环境指纹,让技术团队能够复核每个判断。

记录
原始 JSONL + 汇总报告
原则
超时和失败不得删除
03 ROLLOUT

把结论变成上线计划

任务路由与回退计划

标出适合 V4.1-Flash 的任务、必须保留现有模型的任务,并形成试点、监控和回退条件;不代操作生产环境。

上线
影子流量与小流量试点计划
止损
预先写明回退触发条件
ACCEPTANCE 先写门槛,再跑模型。

样本范围、重复次数、通过标准和不包含项都会在开始前锁定。

查看报价

SERVICE MENU / 服务方案

从免费复跑,到可验收的迁移试点

人民币首发价格用于验证市场需求。第三方 API、GPU、差旅及超出范围的定制工作另计,最终范围以书面确认单为准。

COMMUNITY

公开评测基线

¥0自行运行

  • 3 条 smoke 与 12 条中文业务样本
  • CLI、评分器和结果 Schema
  • 不含业务数据定制和人工结论
查看公开方法
LAUNCH OFFER · 主产品

模型迁移体检

¥9,800人民币 · 一次性服务费

  • 最多 50 条脱敏业务样本
  • 当前模型与 V4.1-Flash 两个端点
  • 材料齐备后 3 个工作日交付
  • 原始记录、决策报告与 60 分钟复盘
选择迁移体检
ENTERPRISE

企业迁移试点

¥39,800 起人民币 · 按书面范围报价

  • 最多 200 条样本与定制评分规则
  • 质量、延迟、token 用量与治理门槛
  • 任务路由、影子流量与回退计划
  • 不含生产环境变更和私有化部署
生成试点需求
客户提供脱敏样本、基线端点、API 额度与业务门槛
验收依据约定样本全部留痕,报告数字可由原始记录复算
可选续约持续回归监控 ¥6,800 / 月起
FIRST 10 / 首批共创 先用公开信息确认是否适合,不提交样本或密钥。

咨询单会公开显示在 GitHub;只写任务类型、当前基线和决策期限,具体数据边界在私下书面确认。

发起评估咨询

BENCHMARK QUEUE / 评测队列

零分数发布,先把方法钉牢

目前没有独立实测结果。每一项只有在原始记录、环境指纹与评分规则齐备后,才能从“待验证”转为“已复现”。

显示 5 / 5 项
轨道 首轮任务 必须记录 状态
真实代码库QUALITY / CODE 缺陷定位、最小补丁、回归测试 patch、测试日志、轮次、token 待验证
长上下文QUALITY / CONTEXT 32K / 128K / 256K / 1M 召回与推理 有效长度、准确率、首 token 延迟 待验证
视觉理解QUALITY / VISION 中文截图、表格、多图关系 原图、缩放策略、逐项判断 待验证
工具意图AGENT / INTENT JSON 约束、只读边界、动作选择 schema、原始输出与违规率 待验证
推理系统SYSTEM / SERVING 启动、并发、长序列稳定性 硬件、版本、显存、TTFT、TPS 待部署
状态门槛

待验证 → 方法与样本公开 → 两次一致运行 → 已复现

0 / 5 已完成

EVIDENCE LEDGER / 证据账本

把“官方写了”与“我们测过”分开

下表只记录可定位的公开字段。官方配置证明模型如何被描述,不自动证明它在目标业务中的表现。

01

原始记录

保留输入、完整输出、逐次运行、错误与评分明细。

02

环境锁定

固定提交版本、推理参数、依赖、硬件与随机种子。

03

基线同场

同一数据、预算和判定规则下比较现有模型。

04

失败可见

公开超时、格式违规、拒答和不可复现的样例。

METHOD LINEAGE / 方法参照

采用成熟评测的可审计规则

借鉴协议,不搬运第三方题目;名称仅表示方法参考,不代表背书。

参考项目 成熟做法 本站落实
Inspect AI ↗SAMPLE LOGS 数据、求解器与评分器分离,保留逐样本日志 Suite / client / scorer 分层;每次 attempt 单独写入 JSONL
lm-eval ↗DECLARATIVE TASKS 声明式任务、任务发现与模型适配层 版本化 JSON / YAML suite、任务列表与 OpenAI-compatible client
HELM ↗MULTI-METRIC 质量、效率与风险分别报告,可下钻样本 准确率、错误率、延迟、TTFT 与 token 分维度呈现
LiveBench ↗FRESHNESS 客观评分、版本发布与污染意识 首发合成样本、确定性 grader、suite SHA 与证据状态
LongBench ↗CONTEXT BANDS 按长度分桶,区分检索与跨段推理 32K 至 1M 渐进档位、seeded 多位置事实组合
SWE-bench ↗EXECUTABLE TASKS 真实仓库任务、可执行验证与隔离环境 路线图;当前代码样本仅为 smoke,不宣称仓库级能力

上线日事实快照

SNAPSHOT · 2026-09-10
官方规模口径552B backbone

技术报告另列 196B Engram;激活参数口径为预填充约 8B、解码约 16B。

官方报告 来源 ↗
Checkpoint 文件审计≈763.2B logical weights

按官方转换代码还原 FP4 双元素并排除 scale 后的近似值,含 backbone、Engram 与 DSpark;HF API 的 484.6B 不能直接当参数量。

独立文件审计 方法 ↗
量化FP8 / expert FP4

quant_method: fp8,专家权重字段为 fp4

官方配置 来源 ↗
稀疏专家384 routed / top 6

配置列出 384 个路由专家,每 token 选择 6 个。

官方配置 来源 ↗
上下文配置1,048,576 positions

配置字段为 1M;参考实现默认 max_seq_len=4096,交互模式覆盖为 64K,并非开箱即用 1M。

待独立验证 来源 ↗
Tokenizer 一致性pad token 待核对

tokenizer_config 将 pad 声明为 EOS,而模型配置和词表使用 id 2;接入框架时需显式检查。

集成风险 来源 ↗
多模态Vision encoder

配置含 32 层视觉编码器;README 称最小推理覆盖视觉编码与对齐。

官方配置 来源 ↗
官方托管 APIdeepseek-flash

1M context;峰时每百万 token 缓存命中 $0.006、未命中输入 $0.30、输出 $1.20,闲时价格减半。

官方文档 价格 ↗
质量 / 速度 / 成本估算尚无本站结论

等待按上方队列运行;不以配置字段代替业务评测。

未测试 查看队列 ↓

MIGRATION INTAKE / 迁移评估

生成一份可确认范围的采购简报

用当前业务约束定义服务范围和对照实验。页面只在本地处理输入,不会发送、保存或上传任何内容。

仅本地生成
请勿填写密钥、客户原文或其他敏感数据。

  1. 1选择服务方案与真实场景
  2. 2锁定基线、范围与决策门槛
  3. 3复制简报,进入书面商务确认
优先验证场景 至少选择一项

部署约束
决策指标 可多选
0 / 240