模型与 Prompt
选择当前可用的模型与部署方式
合并 DeepSeek、千问和区域研究,以任务证据替代泛化排名。
把模型名称、API 别名、具体版本和部署平台拆开记录。同一名字背后的版本可能更新;开源权重、厂商托管与第三方推理服务的速度和费用不能混在一起比较。
理解这条链路
这轮更新后的候选怎么用
文本客服可将 DeepSeek Flash/Pro 与当前百炼文本模型列入待测候选;语音识别、合成与原生语音分别选择对应接口。这里确认的是公开目录和接口存在,尚不能据此判断它们在你的订单查询、拉美口音或多轮工具流程中的胜负。先检查账户、地域和调用形式,再进入相同样本评测。
自部署先算完整资源
权重大小与量化格式只是第一项,还要计算 KV cache、运行时缓冲、并发、上下文长度和显存余量。MoE 的激活参数反映计算路径,不能当作总存储量。必须保留硬件、后端版本、量化、输入长度和并发;未运行时只提供容量估算,不写实测速率。
价格快照怎样保持可用
DeepSeek 当前区分峰谷时段和缓存;百炼还区分模型地域、输入长度和思考模式。将实际用量乘适用单价,并检查重试、输出与缓存命中。公开榜单用于寻找候选,不能代替业务成功率和危险错误验收。
按这个顺序操作
- 从官方目录记录候选的精确模型 ID、版本、访问日期与适用地域。
- 先做账户可用性、工具调用、结构化输出和长上下文的最小接口验证。
- 在同一业务题集、预算和超时下比较实体正确性、最终业务状态与延迟。
- 对真实使用量估算费用,在有限流量内观察退化后再扩大。
可直接复用的记录模板
provider / endpoint / model_id / model_version / checked_at region / account_access / text_or_audio / thinking_mode context_length_used / max_output_used / cache_policy quality:任务完成、关键事实、工具最终状态 latency:首输出、完整任务、失败与超时 cost:输入、输出、缓存、音频与重试 self_host:总权重、KV cache、后端、量化、并发、硬件
做到什么程度才算通过
- 模型别名与具体版本分开记录。
- 参数量不被当作显存实测。
- 排名来自同一任务和条件。
- 所有价格带日期、区域和单位。
本轮只核验公开模型资料,没有调用付费模型或进行硬件压测。模型供应和报价会变化,正式选型前需重新确认。
本轮确认的事实与来源
以下为公开资料支持的具体结论;操作流程和验收建议属于工程推导。仓库说明或厂商效果表述不等于独立实测。
2026-09-08 官方价格页将 deepseek-v4-flash 对应为 DeepSeek-V4-Flash-0731、deepseek-v4-pro 对应为 DeepSeek-V4-Pro-0813,并列出 Responses API、工具调用及峰谷/缓存计费条件。
资料日期:页面未统一标注;以复核日期为准 · 复核:2026-09-08
阅读原始来源 ↗2026-04-24 发布说明披露 Flash 总参数 284B、激活 13B;这是模型结构信息,不能用激活参数量直接估算全部权重显存。
资料日期:2026-04-24 · 复核:2026-09-08
阅读原始来源 ↗百炼国际站模型目录更新于 2026-09-04,推荐项已包括 qwen3.8-max、qwen3.7-plus、qwen3.8-flash 等,旧千问全家桶表不应再称为完整当前目录。
资料日期:2026-09-04 · 复核:2026-09-08
阅读原始来源 ↗OpenAI 当前 Realtime 总览按用途列出 gpt-realtime-2.1、gpt-realtime-translate 与 gpt-live-transcribe;不同任务使用不同会话和接口。
资料日期:页面未统一标注;以复核日期为准 · 复核:2026-09-08
阅读原始来源 ↗这次更新了什么
将三篇 DeepSeek、千问系列和出海模型研究合为一篇;更新当前目录,删除跨榜单综合排名和未经同条件复现的性价比结论。
合并前的内容入口
以下旧地址仍可访问,并会带你来到本篇。完整重构前材料已留存本地备份。
- research-hub/deepseek-v4-flash.html
- research-hub/deepseek-v4-flash-reality.html
- research-hub/deepseek-v4-flash-vs-qwen35-122b.html
- research-hub/qwen-family.html
- research-hub/sea-latam-llm.html