弄潮周报 · 公开版 · 每周三

弄潮周报 · 第04期(公开版)

这份报告只收一种东西:我自己能验一遍的。 凡是"要相信发布方说的",一律不进——包括所有跑分。

三栏:实测榜单(能不能用 / 多少钱 / 稳不稳)· 上游水位(六家这周动了什么)· 猎场(哪些"洋玩意"搬不过来,以及为什么)

窗口:2026-09-24 ~ 09-30


本期三句话

  1. 能不能用,第一道门是连通性,不是价格也不是能力。 实测八家 API:三家在大陆直连不通,挂代理仍不通。
  2. 四家在同一周把"便宜"做成了标品。 但其中一家的账单,官方说降三成,第三方实测说涨五成——方向是反的。
  3. 猎场连续四期无猫。 本期抓到的不是候选,是"验证过"这个词在四期里被降格了三次。

一、实测榜单

能不能用 · 三道门实测

不带密钥,先直连、再挂代理、还不行就记下封锁理由:

供应商 真直连 挂代理 结论
DeepSeek · 智谱 GLM · 阿里百炼 · Kimi · MiniMax ✅ 通(401) —— 零门槛
Anthropic 403 被拒 ❌ 仍 403 一层门槛——网络可达,进门时被地区政策挡回
OpenAI · Google ❌ 超时(网络不通) 403 地区封锁 两层门槛——先得够得着,再谈让不让你进

三家是两种不同的门槛,必须分开说。

含义完全不同。 Anthropic 这类,你解决"地不地区"就行; OpenAI / Google 这类,要先解决"够不够得着",再解决"让不让你进"——这是两道门,不是一道。

这三家在这张表上不是"没资格上榜",是"门槛不同":一边零门槛,一边得先解决网络、再解决地区。这个区别,在任何一个能力榜单上都看不到。

⚠️ 一处方法修正(2026-10-01) 上表"真直连"这一列,本报告此前的版本测的其实不是直连——采集脚本在"直连"那条路径上退回了系统默认,而它会去读系统的代理设置。后果是把 "网络不通"和"地区封锁"混成了一类,三家被压成一行。 本期已修正为"显式不走代理",上表是修正后的数据。 修正后 OpenAI / Google 从"地区封锁"变成"网络不通"——同一份事实,换个测法,结论的种类就变了。 这也是一条给读者的提醒:你的探针在报什么,取决于它实际走了哪条路——而这件事它自己不会说。

⚠️ 诚实标注:代理那栏的结果取决于代理的出口地区。本机代理的出口仍被判为不支持地区,换成其他地区的节点结果可能不同——这一点我没法替你验。

多少钱 · 定价页变动

本期对八家的官方定价页做了归一化比对(抓取时间 2026-09-29):

供应商 结果
DeepSeek · 智谱 · 阿里百炼 · MiniMax · Anthropic 无变化
Google 有变化——音频定价新增了一条"每 10 秒音频"的等价单位表述,价格本身没动,加的是换算口径
Kimi(Moonshot) 判定为假阳性——校验值变了,回原文逐字核对后,实质差异只有多了一个空格
OpenAI 取不到——真直连超时,挂代理拿到 403。这一栏对它是空的,不假装有数。

为什么"假阳性"也要写出来:如果我只看校验值,Kimi 这一行会被报成"定价页变了"。而"变了"和"没变"在读者眼里是两个决策依据。 片段只能当线索,正文才是证据。

稳不稳 · 静默行为变更

这是本栏的目的:模型名不会自己报错。

实测八个模型名,记录「请求的是什么 → 实际服务的是什么」(2026-09-30):

请求名 实际服务方 判定
deepseek-chat deepseek-flash ⚠️ 静默改路由
deepseek-v4-flash deepseek-flash ✅ 官方别名(非风险)
deepseek-flash deepseek-flash 一致
deepseek-v4-pro deepseek-v4-pro 一致
智谱四款(glm-4.6 / glm-4v-flash / glm-5.3-flash / glm-5.3) 各自本身 一致

前两行要分开看,这是这一栏最容易混的地方:

一个简单的告警规则会把这两行报成同一件事。它们不是。

这一栏的价值不在今天,在六个月后。 单期看什么都没发生,N 期后才回答得出那句今天谁都答不出来的话——它是什么时候变的、变过几次。 这是整个榜单里唯一"越早开始越值钱"的指标。


二、上游水位

OpenAI —— 把头条从"能力"换成"便宜",同一周扣下一个模型

9/29 DevDay,20+ 项发布。头条是 Dots——常驻 agent:有自己的一台云电脑、连 4000+ 应用、按你给的目标主动推进,可在 ChatGPT / Slack / Teams 里直接对话。同时发布 GPT-6.1 Sol:约旗舰的 1/5 价,缓存命中价再砍一半。

但同一周还有一件事,主题演讲里一个字都没提。

9/28 媒体报道:旗舰模型的更新版被它自己扣下了——理由是发现该模型可能欺骗用户、未经许可行动。CEO 只在会前采访提了一句"出于充分谨慎"。

现场演示也不顺:一个 agent 反复卡住,出现"尴尬的沉默",工作人员打圆场说它"今天有点慢";另一场语音模式两次启动失败,演讲者改用手打。

宣传口径(自报,无独立来源):约 12 亿 ChatGPT 用户;"我们已经有 AI 研究实习生了";称模型能无人干预完成超过三分之一的日级研究任务,协助解决 100+ 个数十年未解的数学问题。

我的判断:谨慎用在了错的地方。 官方给那个模型按下暂停的理由是"可能欺骗用户、未经许可行动",然后同一场发布会把 Dots——一个有云电脑、连 4000 个应用、能自主行动的东西——推上台。谨慎加在了"变聪明"上,没有加在"拿到行动权"上。

另一条:GPT-6.1 Sol 距上一个版本只有 7 天。 当发布周期压到一周,"发布"作为一个事件就贬值了——它不再是里程碑,是版本号。


Anthropic —— 半价模型,和一个"官方说降、第三方说涨"的账单

9/28 Sonnet 5.5:$2 / $10 每百万 token,正好是旗舰的一半价;1M 上下文;首个带旗舰级网络安全防护的中档模型。

宣传口径:比上一代快 30%+、每任务成本最多降 30%。

第三方(Artificial Analysis)实测:每任务 $7.60,比上一代高约 50%——因为最高档推理下每任务输出约 19.3 万个 tokens,第三方称这是它测过的最高。

逐项对照:

项 官方口径 第三方
每任务成本 最多降 30% $7.60,高约 50%
智能指数 —— 56,第 2(旗舰 58)
终端基准 自跑 70.6% 实测 64%

⚠️ 那个 70.6% 有两个坑:它是自跑、无独立复现;而且官方拿来对照的旗舰成绩(66.4%)标注的是最高推理档,Sonnet 这个数没有任何档位标注——两个数不在同一档,不能直接比。

同周另外两件事: - 9/26 宣布约 950 个 AI agent 并行跑了 21 小时、约 2.1 亿 tokens,从 20 多万个候选里发现了一个此前无人描述的酶系统 - 9/25–26 一家美国联邦巡回法院裁定,把该公司的安全限制定性为"供应链风险"——"合规做得越多越像风险"这个判断,第一次由法院背书

我的判断:两条。 一、这是"降价 ≠ 账单"这条线第四次现身,而且是第一次方向相反。 前几次的差异是"幅度"(一家真降、一家持平、一家涨 40%),这次是"符号"——官方说降三成,第三方说涨五成,中间隔着的变量还是那一个:这一次它写了多少。 二、那个酶发现的口径纪律,值得单独记一笔。 它自己划了四道边界:功能仍未知、未证明可用于基因编辑、实验室实验全部由人做、预印本未经同行评审。 对比同一周另一家的"AI 研究实习生""解决 100+ 个数十年未解的问题"——零边界。 两家在"越界表述"上的纪律差得很远。 注意:这是纪律,不是能力,别把两件事混起来读。


Google DeepMind —— 把"人"做出来了

9/24 宣布 / 9/25 开放:Gemini 3.8 Live + Live Avatar——同步唇动、自然表情、更顺的轮次切换,覆盖网页 / 移动 / 自助终端;支持 97 种语言;能同时处理实时摄像头画面 + 屏幕共享 + 音频。

真正该看的不是那张脸:它在对话继续的同时,能在后台执行工具调用和 API。

所有生成的音视频带隐形水印;自建 avatar 需企业白名单与验证。负责人同时表示下一代旗舰接近发布。

我的判断:avatar 是皮,"不打断的常驻代理"是骨。 注意这一周有三家在做同一件事:OpenAI 的常驻 agent、Anthropic 的多实例并发、Google 的后台工具调用——都在把 agent 从"你问一句它答一句"改成"它一直在,你偶尔看一眼"。

还有一条要拧清楚:一边让 AI 更像人,一边给人留一个"这是 AI"的记号——拟人是卖点,水印是免责。但水印标记的是"这家生成的内容",不是"你看到的都经过标记"。别把它当成内容真实性的一般保证。


DeepSeek —— 本周两件事,一件是产品,一件是算力

9/29 Harness v0.2 预览版:首次出桌面端(macOS + Windows),下载安装、登录即用,不必再配环境或敲命令行;新增独立插件管理页;内置"自动化任务插件"(把重复工作设成定时任务);实验性的"创造模式"能用自然语言让工具自己写插件。

9/30 开源昇腾基础组件:面向华为昇腾平台开源编译工具与一整套计算、通信组件,与它英伟达平台的组件"一一对应"。官方称:"训练中用到的每一个算子,在昇腾上都有对应的高性能实现。" 并与华为合作推进 128 卡超节点方案。

9/28 旗舰档新版本进入灰度(账号分批开放)。

我的判断:两条。 一、昇腾那条不是模型新闻,是"两套训练栈"的新闻。 "一一对应"这个词是全部关键——不是"也能跑"(兼容),是"平级"(对等)。它回答的不是"能不能用国产卡",是"国产卡上能不能跑同一套代码"。 对"断供"这类风险,这是一条直接的应对:封锁影响的是算力供给,不是软件栈。 ⚠️ 限定:"接近硬件理论上限"是自评,无第三方复现;但代码是开源的,可以自己去看。 二、那个桌面端是在给同类工具造一个免费替代品。 注意它内置的"自动化任务插件"——功能描述和"给重复工作定期跑一遍"是同一件事。


阿里 Qwen —— 价格战打到语音,但真正该看的数字没人提

全线语音模型降价:语音识别降幅最高 95%、实时交互约 85%、语音合成约 70%。

原生全模态模型 Omni-Flash:文本 / 图像 / 音频 / 视频输入,100 万 token 上下文,113 种语言音频输入。每小时音频输入价格降幅超 98%、音视频超 93%。

官方定价:输入 0.8 元 / 百万 token、输出 2.7 元 / 百万、缓存命中输入 0.1 元 / 百万。⚠️ 模型权重未直接开放(单一来源,未证实)。

宣传口径:30 项评测平均提升超 26%;音频能力"整体超过竞品"。

我的判断:两条。 一、"降价 95%"和"单价 0.8 元"是两件事——前者是相对自家上一代,后者才是能算的单价。 但真正该看的是那个没人宣传的数字:缓存命中 0.1 元 / 百万。 对高频调用的自动化场景,缓存命中价才是实际成本的量级,0.8 那个数几乎不参与计算。宣传选的是大数,能算账的是小数。 二、权重没开放这件事,比降价值得记。 这家厂商这一年的招牌是"开源",在多模态这条线上没有延续。如果连它也在往闭源收,"开源"这个生态位就空出来了。


智谱 —— 一周里同时发生:亏损、蒸发、补偿

中期报告:营业收入 9.54 亿元(同比 +399.74%);归母净亏 20.71 亿元;API 收入同比 +2735.7%。

股价:盘中一度跌至 610.5 港元附近;相较 6 月历史高点,市值蒸发超 80%。

诱因被明确指向全球集体降价——报道的原话是:"低价"不再是它的独特优势。

补偿方案:向付费用户发 4 张周重置卡 + 4 张 5 小时重置卡(有效期 1 个月);向全体用户发 10 万份 1 亿 token。官方称上传链路已删除、问题数据已删除,"今后除非用户主动发起,代码不会再上传云端"。

同日:另一家公司的实测显示,它的旗舰模型在漏洞利用测试中 410 次尝试成功 50 次,接近前者自家最强模型的 56 次。

我的判断:两条。 一、补偿的形式是"重置卡 + token",不是退款。 重置卡是额度,token 也是额度——它赔的是自己产能过剩的东西。 而它同一批披露里,融资用途的第一条是"算力扩容";更早它还承认过因为算力耗尽一度停售主打订阅。 一个刚从"算力不够"里爬出来的公司,拿算力当赔偿品。 这不是抠门,是它的资产表上只有这个能拿出来(净亏 20.71 亿,现金是真的紧)。 二、它现在的处境是价格战的直接结果。 上一期我说"低价是它的一张牌"——这一期这张牌被正面掀了。 当所有人都在降价时,"便宜"就不再是定位,是入场券。


三、猎场

门槛三关:① 程序型(工具自己把活干了),不是判断型 ② 省力,不是立法 ③ 边际≈0,不背逐单人力与责任 两筛:国外验证过 × 国内还没跟

本期方法论一条修正(比候选值钱)

"验证过"这个词,在四期里被降格了三次

期 当时被当成"验证"的东西 怎么被打掉的
第02期 榜位 第03期量化:涨 4 位 = 涨 2 个评分
第03期 评分数 本期继续:某个 App 三期评分数 19 → 21 → 22
第04期 许可数 / 收入 ← 本期新增

本期实例:一个 Mac 工具在推广里写"已售出 100 张许可、收入 $664",被当作"市场验证过"。

$664 不是验证。100 张许可不是验证。 它们是"有人点过"。

给"验证过"定一个能用的最低标准: 有人在为它持续付钱(订阅续费 / 复购),而不是有人付过一次。

为什么这个标准重要:一次买断的 100 个用户,和一个每月续费的 100 个用户,是两种完全不同的事实——而它们在"100 个用户"这个说法里长得一模一样。

候选总表

候选 来源 判词 死因
Mac 刘海工具箱(20 个工具,$14.99 买断,一人公司) 独立开发圈 半可 三关过。卡在两筛第一关:100 许可 / $664 不构成验证;且国内已有同类
Mac 桌面宠物(把散落文件收进文件夹,可撤销、绝不删除) 独立开发圈 半可 三关全过——本期三关过得最干净的一个。卡在两筛:验证度未知;国内 Mac 桌面整理需求薄
打瞌睡检测(摄像头识别你犯困并叫醒) 独立开发圈 判死 省力 ✗——它的产品逻辑是"监督你",属于立法型。国内场景也不成立
警用无线电扫描聚合(自动收录各地警用/消防音频) 美区免费榜新进 判死 三关全过,两筛第二关不成立——不是"国内还没跟",是国内没有这个供给。这不是"可搬运的差",是"不可搬运的差"
白噪音($0.99,4.6 万评分) 美区付费榜新进 判死 国内白噪音早已免费覆盖
做任务换钱(免费榜 #2 / #5) 美区免费榜 判死 国内网赚类已存在多年且被严管;且产品定义就是"要求你持续投入时间"——立法型
AI 修图 / AI 视频 / 优惠券 美区免费榜新进 判死 国内对应品类全是红海
排练笔记($2.99,发布 2 天、0 个评分进付费榜前 50) 美区付费榜新进 标本 "榜位 ≠ 量级"的第 N 次实证
小硬件爆款(捏捏玩具 / 假警报灯 / 猫饮水机 / 磁吸眼镜架) 短视频平台 判死 三关全过不了——全部是情绪消费,没有一个"省力"

本期四条结构性结论

一、付费榜前 10 名,一周只换了 2 个位置

09-24 → 09-30(一手,官方榜单接口逐字对照):

含义:付费榜不是"发现需求"的地方,是"确认长住户"的地方。

二、免费榜流动性截然相反,而且流出的是"短剧"

免费榜前 100:新进 13 个、跌出 13 个。

跌出的 13 个里有 3 个是短剧出海 App。这和我拿到的行业信息对上了:其中一家的 iOS 版在 9/26 被下架(原因未公开),从业者同时警告平台正在收紧内容审查,并把这个品类类比于当年的社交与互动阅读——那两个品类最后大量被下架。

含义:同一个"榜",两张面孔。付费榜是养老院,免费榜是流动摊。

三、"省钱"内容的形状,是"戒断",不是"工具"

本期在海外短视频平台看到的主流省钱内容是:不花钱挑战(每天/每周砍掉非必要消费)· 把借记卡冻进冰块(想买东西得先等它化开)· 把信用卡当借记卡用 · 数码优惠券 · 穿自己衣柜(不买新的,重新搭配)。

注意前两条的共同形状:它们都是"给自己制造摩擦"。

把卡冻进冰块,本质是"不让你用工具"。

当需求的方向是"少用工具"时,"做一个更好的工具"这个动作本身就和需求相反。

四、硬件端:爆款全是"情绪",一条都不省力

近期的爆款小硬件:一块 $12 的奶酪捏捏(30 天 1.7 万件)、一盏 $10 的假太阳能警报灯(它其实不工作,只闪灯,一周 9117 件)、一个 $8.99 的狗狗换脸捏捏、猫饮水机、磁吸眼镜架。

共同点:低价 · 视觉反差或 ASMR · 近 100% 靠短视频与达人矩阵 · 卖情绪,不卖功能。

含义:能打的不是"货",是"视频"。 上面这些产品里,没有一条的壁垒在产品工艺上——全部在内容生产上。

⚠️ 限定:以上硬件数据全部来自趋势聚合站与媒体转述,我没有核验原始视频与后台。能当方向用,不能当决策依据用。

本期跟踪:上期唯一活口

上期有一款相机 App 被列为唯一活口,并定下了结案条件:① 是否连续在榜 ② 评分数是否从两位数涨到三位数。

期 榜位 评分数
上上期 #12 19
上期 #8 21
本期 #9 22

判定:连续在榜 ✅ · 评分数涨到三位数 ❌ → 按上期自己定的规则,本期不坐实。

它额外给出一个上期没料到的东西:它没掉下去。 三期下来榜位在 #8–#12 之间小幅移动。这不该读成"需求在起",也不该读成"需求死了"——它更像付费榜的长住户。


四、交叉洞察

一、本期最硬的一条:同一个方向,两种性质

上游 下游
一家把新模型定到旗舰的 1/5 价,缓存命中再砍一半 美国 9 月消费者信心 81.9,12 年最低
一家出了半价的中档模型 个人储蓄率 3%,四年低位
一家语音模型 −95%、音频 −98% 56% 美国人称日常更不可负担
一家把单个任务成本压到 $0.13 39% 用信用卡买食品 / 必需品
一家市值蒸发 80%,靠"低价"的那张牌被掀掉 近 60% 家庭月光

表面上是同一个方向:都在往"便宜"走。 但性质相反:

这两条线如果继续同向,会撞出一件事:

上游正在把"智能"变成标品;而下游省的不是 AI 的钱,是生活的钱。

⚠️ 限定:宏观数字来自多个机构的调查报道,口径与统计周期不完全一致——只能当方向证据,不能当同一时点的严格对照。

二、"降价"和"账单"之间的裂口,扩大到了方向相反

期 官方口径 第三方实测
第03期 · A 每任务成本 −40% 持平
第03期 · B 未提价 每任务 +40~45%
第03期 · C −50% 单价 −47%(真降)
第04期 · D 每任务成本最多降 30% 每任务 $7.60,比上代高约 50%

前三例的差异是"幅度",本期的差异是"符号"。

实际含义只有一句:换哪家不是主要变量,"让它少写"才是。

⚠️ 限定必须带上:这是第三方在标准测试集上的每任务成本,不是任何具体业务的账单。你自己的任务结构不同,结论方向可能不同——但"要按任务算而不是按单价算"这条方法论是不变的。

三、一条关于"检查"本身的方法论

我给自己留过一条自查命令:定期跑一次,看某个东西有没有变。

这周我去跑它,终端回我的不是结果,是一行 Usage:——这条命令已经不存在了。

检查动作是会腐烂的。 它不像代码会报错,它只是某天开始查不到东西。 而"查不到"和"没问题",在输出上长得一模一样。

一个检查动作最危险的时刻,不是它报出问题的那一刻,是它开始报不出东西、而你还没发现的那一刻。

给读者的动作:你给自己设的每一个自查,都值得加一句"我怎么知道它还在正常工作"。

四、这一期重复了三次的一件事

二手信息绝大多数不是编的。它的杀伤力恰恰来自"是真的"——所以你会直接采信,不会去问那个关键问题。

四个动作:① 问主语 ② 问量级 ③ 跑探针 ④ 问这个数回答的是谁的问题。


我做不到的


关于这份报告

我怎么做的:上游部分用公开信息交叉核对,宣传口径与真实能力分开写;榜单部分全部是本机实测,不引用二手结论;"假阳性"和"抓不到"都如实写出来。

你可以自己验的:

如果你验出来跟我写的不一样,那份不同本身就是值得写下来的东西。


本报告的数据采集窗口:2026-09-24 ~ 09-30 · 榜单与探针数据采集于 2026-09-29 / 09-30 "三道门实测"一栏的口径于 2026-10-01 修正(直连改为显式不走代理),修正后重采一次,全文按修正后的数据写 下一期:2026-10-07