DeepSeek 是中国的大模型公司,中文名「深度求索」,官网标题写的就是 DeepSeek | 深度求索,运营主体为杭州深度求索人工智能基础技术研究有限公司。它由梁文锋创办、脱胎于量化投资机构幻方量化——早年为量化交易自建的算力集群,成了后来训练大模型的底子。它常被拆写成「deep seek」、误写成「深度探索」,指的是同一家。日常使用走网页版 chat.deepseek.com 最省事,不必安装任何东西。
⚠️ DeepSeek 的域名摊得比同行散,一次分清:www.deepseek.com 是公司官网,本身不是聊天框,首页四个按钮各管一摊——「开始对话」指向 chat.deepseek.com(C 端网页版对话入口)、「API 开放平台」指向 platform.deepseek.com(拿密钥、充值)、「API 文档」指向 api-docs.deepseek.com/zh-cn/(独立文档站,中英双语)、「获取 App」指向 download.deepseek.com/app/(官方下载页)。此外还有 status.deepseek.com(服务状态)、talent.deepseek.com(招聘)与 www.deepseek.com/transparency/(透明度中心)。认准这几个域名——DeepSeek 是全网被仿冒最狠的国产 AI 品牌之一,各种「deepseek官网」「DeepSeek 满血版」的山寨站与套壳收费 App 泛滥,官方 C 端从不收订阅费。
登录方式很干脆:登录页只有一个账号输入框,占位符原文是「请输入手机号/邮箱地址」——手机号和邮箱共用一栏,配密码登录,旁边是「忘记密码」与「立即注册」。第三方登录只给两个:使用 Google 账号登录、使用 Apple 账号登录。注意这里没有微信、也没有 QQ——豆包、元宝、文心那一票国产助手清一色主推微信扫码,DeepSeek 一个都不给,这在国产 AI 助手里是少数派,习惯了微信一键登录的人第一次进来容易愣一下。另外 DeepSeek 是在境内持证运营的中国公司服务,官网页脚公示了浙ICP备2023025841号、增值电信业务经营许可证浙B2-20250178、浙公网安备33010502011812号,都能在工信部与公安部备案系统查到。
进去之后你会发现,DeepSeek网页版把能力切成了「模式」而不是「模型」。输入框上方是三个模式标签:快速模式(默认,页面标题直接写「使用快速模式开始对话」)、专家模式、识图模式;输入框里另有两个可叠加的开关:深度思考与智能搜索(官方叫法是「智能搜索」,不是大家通常以为的「联网搜索」)。「专家模式」和「深度思考」是两个不同层级的东西——前者是模式标签,后者是输入框里的开关,两者能叠加,很多人会把这俩当成一回事。整个输入区没有模型选择器:你选不了 V4-Pro 还是 V4-Flash,只能选模式,这点和千问、元宝那种直接把模型档列出来让你挑的产品不一样。
文件上传在输入框右下角的回形针,点开的官方提示原文是:「快速模式下,仅识别图片与文件中的文字/最多 50 个,每个 100 MB」。50 个文件、单个 100 MB 这个额度在同类里相当宽(Kimi网页版也是同样的 50 个 / 100M)。但前半句才是真正的坑:在默认的快速模式下传 PDF,它只把文字抠出来,不做通读分析——你以为它读完了整份文档,其实拿到的只是 OCR 结果。要让它真正读,得先切到专家模式再传。这是最容易白传一遍、还以为是模型不行的地方。
当前模型是 DeepSeek-V4,官方标注预览版。发布时间以官方透明度中心的公示为准:DeepSeek-V4 发布于 2026 年 4 月 24 日,上一代 DeepSeek-V3.2 发布于 2025 年 12 月 1 日(该页同时挂出每代的模型卡与技术报告)。官网首页公告原话是:「DeepSeek-V4 预览版本发布,具备世界顶级推理性能,Agent 能力大幅提高,已在网页端、APP 和 API 上线。」也就是说网页版跑的就是 V4,与 API 同代,这点和某些「网页版跑阉割版」的同行不同。V4 分两档,参数规模官方技术文档写得很实:V4-Pro 总参数 1.6T、激活 49B,V4-Flash 总参数 284B、激活 13B,两者上下文都是 100 万 token——这个数字有独立佐证:两档权重的 config.json 里 max_position_embeddings 均为 1048576,正好 1M,与文档口径对得上。架构上都是 MoE(V4-Pro 61 层、384 个路由专家、每 token 激活 6 个;V4-Flash 43 层、256 个路由专家),存储精度为 FP4 + FP8 混合(专家参数走 FP4)。官方称预训练用了超过 32T token,并靠混合注意力(CSA + HCA)把长上下文成本压下来——按技术报告的说法,在 1M 上下文场景下 V4-Pro 单 token 推理只需 V3.2 的 27% FLOPs 与 10% KV cache。
🔴 「DeepSeek 是开源的」这句话,一半对得离谱、一半会坑到你。先说对的那一半:V4 的权重是真给的,而且给得很彻底——Hugging Face 上 deepseek-ai 组织有 101 个模型,DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 都在,许可证是 MIT(README 明写「repository and the model weights are licensed under the MIT License」),连未经指令微调的 -Base 版都一并放出,官方同步发在 ModelScope(魔搭),大陆可直连。这跟隔壁形成鲜明对照:通义千问当家的 Qwen3.7 至今闭源、只提供服务,而 DeepSeek 把网页版正在跑的这一代直接扔了出来——在「旗舰是否开源」这件事上,DeepSeek 是国产里最实在的一个。现在说坑人的那一半:权重能下 ≠ 你跑得动。V4-Pro 是 1.6T 参数的庞然大物,官方推理代码默认就写着 8 路模型并行(MP=8)、并额外给了多节点脚本——这是机房的活,不是个人显卡的活;相对现实的 V4-Flash 也是 284B。官方还提醒:本地部署建议 temperature = 1.0, top_p = 1.0,跑 Think Max 推理模式时上下文窗口建议至少开到 384K。所以「开源」对绝大多数人的真实价值,是让第三方云和企业能合法自建、让研究者能拆开看,而不是你在自己电脑上装一个。个人想用,老老实实开 chat.deepseek.com。
还有个容易白跑一趟的落差:找 V4 别去 GitHub。github.com/deepseek-ai 组织下没有 DeepSeek-V4 仓库,官网首页的「研究」列表也还停在 DeepSeek-R1、DeepSeek-V3、Coder-V2、VL、Math、LLM 这些老条目上。V4 的权重、模型卡与技术报告全部挂在 Hugging Face(技术报告 PDF 直接放在 V4-Pro 仓库里),GitHub 那边近期活跃的反而是基础设施项目——DeepSpec、DeepGEMM、DeepEP、FlashMLA、3FS、Engram,以及 DeepSeek-OCR / OCR-2。换句话说,GitHub 是它放「怎么把模型跑快」的地方,Hugging Face 才是放模型本身的地方。
开发者这边有两个官方钩子,导航站基本不会提。其一,DeepSeek 官方支持 Anthropic API 格式:除 OpenAI 格式的 https://api.deepseek.com 外,另有 https://api.deepseek.com/anthropic,装上 Anthropic SDK、把 ANTHROPIC_BASE_URL 与 ANTHROPIC_API_KEY 指过来即可。官方还做了模型名映射:claude-opus 开头映射到 deepseek-v4-pro,claude-haiku / claude-sonnet 开头映射到 deepseek-v4-flash,文档明说这样可以在新版 Claude Desktop 的 developer 模式里绕过模型名限制、把 DeepSeek 接进去(Claude Code 同理)。注意兼容不是全量:anthropic-beta、anthropic-version、mcp_servers、service_tier 等字段会被忽略。其二,思考模式有个坑:官方默认 thinking 就是开启(enabled),强度用 reasoning_effort 控制,只认 high 与 max——low、medium 会被映射成 high,xhigh 映射成 max;碰上 Claude Code、OpenCode 这类复杂 Agent 请求,effort 会自动拉到 max。而思考模式下 temperature、top_p、presence_penalty、frequency_penalty 统统不生效——官方为兼容老软件特意做成「设了不报错,但也不起作用」,这是最容易让人调半天参数还纳闷的地方。文档站另有多轮对话、对话前缀续写(Beta)、FIM 补全(Beta)、JSON Output、Tool Calls、上下文硬盘缓存、限速与隔离等专页。
⚠️ 时效提醒(这条正在生效,务必看日期):官方公告的旧模型名弃用时间点是北京时间 2026-07-24 23:59——deepseek-chat 与 deepseek-reasoner 这两个沿用已久的名字在此之后弃用。官方做了向后兼容:二者分别对应 deepseek-v4-flash 的非思考模式与思考模式,所以程序不会立刻报错、调用也不会中断,但你实际拿到的已经是 V4-Flash 的行为。另有一条同源规则可当兜底参考:文档写明,给 Anthropic 格式接口传入不支持的模型名时,后端会自动映射到 deepseek-v4-flash。建议直接把模型名切到 deepseek-v4-flash 或 deepseek-v4-pro——一是行为明确,二是想用 Pro 档的话,靠旧名是永远拿不到的(旧名只映射到 Flash)。
同类怎么选:DeepSeek 的强项是推理与代码能力、C 端彻底免费不搞会员分层,以及旗舰权重真开源(MIT)——想合法自建或拆开研究,它是国产里最痛快的。要一次喂超长中文文档、跑 Agent 任务,Kimi 更顺手;要语音、生图、PPT 和桌面办公自动化这类全家桶体验,看字节的豆包;要功能矩阵最全、尺寸最丰富的开源家族(从 0.8B 到 397B 都有,能塞进消费级显卡),看阿里的通义千问——DeepSeek 虽开源但最小也是 284B,个人自部署这件事上反而是千问更实际;要微信生态检索,看腾讯元宝。几家 C 端都免费、都是境内直连,可以都开号交叉用。想横向看这几家的模型贵不贵、能力排第几,本站有 大模型价格库、大模型能力排行榜、国产大模型一览与 开源大模型一览,比逐个翻官网快得多。