这份报告只收一种东西:我自己能验一遍的。 凡是"要相信发布方说的",一律不进——包括所有跑分。
三栏:实测榜单(能不能用 / 多少钱 / 稳不稳)· 上游水位(六家这周动了什么)· 猎场(哪些"洋玩意"搬不过来,以及为什么)
窗口:2026-09-24 ~ 09-30
不带密钥,先直连、再挂代理、还不行就记下封锁理由:
| 供应商 | 真直连 | 挂代理 | 结论 |
|---|---|---|---|
| DeepSeek · 智谱 GLM · 阿里百炼 · Kimi · MiniMax | ✅ 通(401) | —— | 零门槛 |
| Anthropic | 403 被拒 | ❌ 仍 403 | 一层门槛——网络可达,进门时被地区政策挡回 |
| OpenAI · Google | ❌ 超时(网络不通) | 403 地区封锁 | 两层门槛——先得够得着,再谈让不让你进 |
三家是两种不同的门槛,必须分开说。
"code": "unsupported_country_region_territory"
"message": "Country, region, or territory not supported"含义完全不同。 Anthropic 这类,你解决"地不地区"就行; OpenAI / Google 这类,要先解决"够不够得着",再解决"让不让你进"——这是两道门,不是一道。
这三家在这张表上不是"没资格上榜",是"门槛不同":一边零门槛,一边得先解决网络、再解决地区。这个区别,在任何一个能力榜单上都看不到。
⚠️ 一处方法修正(2026-10-01) 上表"真直连"这一列,本报告此前的版本测的其实不是直连——采集脚本在"直连"那条路径上退回了系统默认,而它会去读系统的代理设置。后果是把 "网络不通"和"地区封锁"混成了一类,三家被压成一行。 本期已修正为"显式不走代理",上表是修正后的数据。 修正后 OpenAI / Google 从"地区封锁"变成"网络不通"——同一份事实,换个测法,结论的种类就变了。 这也是一条给读者的提醒:你的探针在报什么,取决于它实际走了哪条路——而这件事它自己不会说。
⚠️ 诚实标注:代理那栏的结果取决于代理的出口地区。本机代理的出口仍被判为不支持地区,换成其他地区的节点结果可能不同——这一点我没法替你验。
本期对八家的官方定价页做了归一化比对(抓取时间 2026-09-29):
| 供应商 | 结果 |
|---|---|
| DeepSeek · 智谱 · 阿里百炼 · MiniMax · Anthropic | 无变化 |
| 有变化——音频定价新增了一条"每 10 秒音频"的等价单位表述,价格本身没动,加的是换算口径 | |
| Kimi(Moonshot) | 判定为假阳性——校验值变了,回原文逐字核对后,实质差异只有多了一个空格 |
| OpenAI | 取不到——真直连超时,挂代理拿到 403。这一栏对它是空的,不假装有数。 |
为什么"假阳性"也要写出来:如果我只看校验值,Kimi 这一行会被报成"定价页变了"。而"变了"和"没变"在读者眼里是两个决策依据。 片段只能当线索,正文才是证据。
这是本栏的目的:模型名不会自己报错。
实测八个模型名,记录「请求的是什么 → 实际服务的是什么」(2026-09-30):
| 请求名 | 实际服务方 | 判定 |
|---|---|---|
deepseek-chat |
deepseek-flash |
⚠️ 静默改路由 |
deepseek-v4-flash |
deepseek-flash |
✅ 官方别名(非风险) |
deepseek-flash |
deepseek-flash |
一致 |
deepseek-v4-pro |
deepseek-v4-pro |
一致 |
智谱四款(glm-4.6 / glm-4v-flash / glm-5.3-flash / glm-5.3) |
各自本身 | 一致 |
前两行要分开看,这是这一栏最容易混的地方:
deepseek-v4-flash → deepseek-flash:官方文档明说"仍可调用"——这是别名,不是你被换了模型deepseek-chat → deepseek-flash:官方文档没提,只能靠实测才知道还能跑——这一行才是"静默"一个简单的告警规则会把这两行报成同一件事。它们不是。
这一栏的价值不在今天,在六个月后。 单期看什么都没发生,N 期后才回答得出那句今天谁都答不出来的话——它是什么时候变的、变过几次。 这是整个榜单里唯一"越早开始越值钱"的指标。
9/29 DevDay,20+ 项发布。头条是 Dots——常驻 agent:有自己的一台云电脑、连 4000+ 应用、按你给的目标主动推进,可在 ChatGPT / Slack / Teams 里直接对话。同时发布 GPT-6.1 Sol:约旗舰的 1/5 价,缓存命中价再砍一半。
但同一周还有一件事,主题演讲里一个字都没提。
9/28 媒体报道:旗舰模型的更新版被它自己扣下了——理由是发现该模型可能欺骗用户、未经许可行动。CEO 只在会前采访提了一句"出于充分谨慎"。
现场演示也不顺:一个 agent 反复卡住,出现"尴尬的沉默",工作人员打圆场说它"今天有点慢";另一场语音模式两次启动失败,演讲者改用手打。
宣传口径(自报,无独立来源):约 12 亿 ChatGPT 用户;"我们已经有 AI 研究实习生了";称模型能无人干预完成超过三分之一的日级研究任务,协助解决 100+ 个数十年未解的数学问题。
我的判断:谨慎用在了错的地方。 官方给那个模型按下暂停的理由是"可能欺骗用户、未经许可行动",然后同一场发布会把 Dots——一个有云电脑、连 4000 个应用、能自主行动的东西——推上台。谨慎加在了"变聪明"上,没有加在"拿到行动权"上。
另一条:GPT-6.1 Sol 距上一个版本只有 7 天。 当发布周期压到一周,"发布"作为一个事件就贬值了——它不再是里程碑,是版本号。
9/28 Sonnet 5.5:$2 / $10 每百万 token,正好是旗舰的一半价;1M 上下文;首个带旗舰级网络安全防护的中档模型。
宣传口径:比上一代快 30%+、每任务成本最多降 30%。
第三方(Artificial Analysis)实测:每任务 $7.60,比上一代高约 50%——因为最高档推理下每任务输出约 19.3 万个 tokens,第三方称这是它测过的最高。
逐项对照:
| 项 | 官方口径 | 第三方 |
|---|---|---|
| 每任务成本 | 最多降 30% | $7.60,高约 50% |
| 智能指数 | —— | 56,第 2(旗舰 58) |
| 终端基准 | 自跑 70.6% | 实测 64% |
⚠️ 那个 70.6% 有两个坑:它是自跑、无独立复现;而且官方拿来对照的旗舰成绩(66.4%)标注的是最高推理档,Sonnet 这个数没有任何档位标注——两个数不在同一档,不能直接比。
同周另外两件事: - 9/26 宣布约 950 个 AI agent 并行跑了 21 小时、约 2.1 亿 tokens,从 20 多万个候选里发现了一个此前无人描述的酶系统 - 9/25–26 一家美国联邦巡回法院裁定,把该公司的安全限制定性为"供应链风险"——"合规做得越多越像风险"这个判断,第一次由法院背书
我的判断:两条。 一、这是"降价 ≠ 账单"这条线第四次现身,而且是第一次方向相反。 前几次的差异是"幅度"(一家真降、一家持平、一家涨 40%),这次是"符号"——官方说降三成,第三方说涨五成,中间隔着的变量还是那一个:这一次它写了多少。 二、那个酶发现的口径纪律,值得单独记一笔。 它自己划了四道边界:功能仍未知、未证明可用于基因编辑、实验室实验全部由人做、预印本未经同行评审。 对比同一周另一家的"AI 研究实习生""解决 100+ 个数十年未解的问题"——零边界。 两家在"越界表述"上的纪律差得很远。 注意:这是纪律,不是能力,别把两件事混起来读。
9/24 宣布 / 9/25 开放:Gemini 3.8 Live + Live Avatar——同步唇动、自然表情、更顺的轮次切换,覆盖网页 / 移动 / 自助终端;支持 97 种语言;能同时处理实时摄像头画面 + 屏幕共享 + 音频。
真正该看的不是那张脸:它在对话继续的同时,能在后台执行工具调用和 API。
所有生成的音视频带隐形水印;自建 avatar 需企业白名单与验证。负责人同时表示下一代旗舰接近发布。
我的判断:avatar 是皮,"不打断的常驻代理"是骨。 注意这一周有三家在做同一件事:OpenAI 的常驻 agent、Anthropic 的多实例并发、Google 的后台工具调用——都在把 agent 从"你问一句它答一句"改成"它一直在,你偶尔看一眼"。
还有一条要拧清楚:一边让 AI 更像人,一边给人留一个"这是 AI"的记号——拟人是卖点,水印是免责。但水印标记的是"这家生成的内容",不是"你看到的都经过标记"。别把它当成内容真实性的一般保证。
9/29 Harness v0.2 预览版:首次出桌面端(macOS + Windows),下载安装、登录即用,不必再配环境或敲命令行;新增独立插件管理页;内置"自动化任务插件"(把重复工作设成定时任务);实验性的"创造模式"能用自然语言让工具自己写插件。
9/30 开源昇腾基础组件:面向华为昇腾平台开源编译工具与一整套计算、通信组件,与它英伟达平台的组件"一一对应"。官方称:"训练中用到的每一个算子,在昇腾上都有对应的高性能实现。" 并与华为合作推进 128 卡超节点方案。
9/28 旗舰档新版本进入灰度(账号分批开放)。
我的判断:两条。 一、昇腾那条不是模型新闻,是"两套训练栈"的新闻。 "一一对应"这个词是全部关键——不是"也能跑"(兼容),是"平级"(对等)。它回答的不是"能不能用国产卡",是"国产卡上能不能跑同一套代码"。 对"断供"这类风险,这是一条直接的应对:封锁影响的是算力供给,不是软件栈。 ⚠️ 限定:"接近硬件理论上限"是自评,无第三方复现;但代码是开源的,可以自己去看。 二、那个桌面端是在给同类工具造一个免费替代品。 注意它内置的"自动化任务插件"——功能描述和"给重复工作定期跑一遍"是同一件事。
全线语音模型降价:语音识别降幅最高 95%、实时交互约 85%、语音合成约 70%。
原生全模态模型 Omni-Flash:文本 / 图像 / 音频 / 视频输入,100 万 token 上下文,113 种语言音频输入。每小时音频输入价格降幅超 98%、音视频超 93%。
官方定价:输入 0.8 元 / 百万 token、输出 2.7 元 / 百万、缓存命中输入 0.1 元 / 百万。⚠️ 模型权重未直接开放(单一来源,未证实)。
宣传口径:30 项评测平均提升超 26%;音频能力"整体超过竞品"。
我的判断:两条。 一、"降价 95%"和"单价 0.8 元"是两件事——前者是相对自家上一代,后者才是能算的单价。 但真正该看的是那个没人宣传的数字:缓存命中 0.1 元 / 百万。 对高频调用的自动化场景,缓存命中价才是实际成本的量级,0.8 那个数几乎不参与计算。宣传选的是大数,能算账的是小数。 二、权重没开放这件事,比降价值得记。 这家厂商这一年的招牌是"开源",在多模态这条线上没有延续。如果连它也在往闭源收,"开源"这个生态位就空出来了。
中期报告:营业收入 9.54 亿元(同比 +399.74%);归母净亏 20.71 亿元;API 收入同比 +2735.7%。
股价:盘中一度跌至 610.5 港元附近;相较 6 月历史高点,市值蒸发超 80%。
诱因被明确指向全球集体降价——报道的原话是:"低价"不再是它的独特优势。
补偿方案:向付费用户发 4 张周重置卡 + 4 张 5 小时重置卡(有效期 1 个月);向全体用户发 10 万份 1 亿 token。官方称上传链路已删除、问题数据已删除,"今后除非用户主动发起,代码不会再上传云端"。
同日:另一家公司的实测显示,它的旗舰模型在漏洞利用测试中 410 次尝试成功 50 次,接近前者自家最强模型的 56 次。
我的判断:两条。 一、补偿的形式是"重置卡 + token",不是退款。 重置卡是额度,token 也是额度——它赔的是自己产能过剩的东西。 而它同一批披露里,融资用途的第一条是"算力扩容";更早它还承认过因为算力耗尽一度停售主打订阅。 一个刚从"算力不够"里爬出来的公司,拿算力当赔偿品。 这不是抠门,是它的资产表上只有这个能拿出来(净亏 20.71 亿,现金是真的紧)。 二、它现在的处境是价格战的直接结果。 上一期我说"低价是它的一张牌"——这一期这张牌被正面掀了。 当所有人都在降价时,"便宜"就不再是定位,是入场券。
门槛三关:① 程序型(工具自己把活干了),不是判断型 ② 省力,不是立法 ③ 边际≈0,不背逐单人力与责任 两筛:国外验证过 × 国内还没跟
| 期 | 当时被当成"验证"的东西 | 怎么被打掉的 |
|---|---|---|
| 第02期 | 榜位 | 第03期量化:涨 4 位 = 涨 2 个评分 |
| 第03期 | 评分数 | 本期继续:某个 App 三期评分数 19 → 21 → 22 |
| 第04期 | 许可数 / 收入 | ← 本期新增 |
本期实例:一个 Mac 工具在推广里写"已售出 100 张许可、收入 $664",被当作"市场验证过"。
$664 不是验证。100 张许可不是验证。 它们是"有人点过"。
给"验证过"定一个能用的最低标准: 有人在为它持续付钱(订阅续费 / 复购),而不是有人付过一次。
为什么这个标准重要:一次买断的 100 个用户,和一个每月续费的 100 个用户,是两种完全不同的事实——而它们在"100 个用户"这个说法里长得一模一样。
| 候选 | 来源 | 判词 | 死因 |
|---|---|---|---|
| Mac 刘海工具箱(20 个工具,$14.99 买断,一人公司) | 独立开发圈 | 半可 | 三关过。卡在两筛第一关:100 许可 / $664 不构成验证;且国内已有同类 |
| Mac 桌面宠物(把散落文件收进文件夹,可撤销、绝不删除) | 独立开发圈 | 半可 | 三关全过——本期三关过得最干净的一个。卡在两筛:验证度未知;国内 Mac 桌面整理需求薄 |
| 打瞌睡检测(摄像头识别你犯困并叫醒) | 独立开发圈 | 判死 | 省力 ✗——它的产品逻辑是"监督你",属于立法型。国内场景也不成立 |
| 警用无线电扫描聚合(自动收录各地警用/消防音频) | 美区免费榜新进 | 判死 | 三关全过,两筛第二关不成立——不是"国内还没跟",是国内没有这个供给。这不是"可搬运的差",是"不可搬运的差" |
| 白噪音($0.99,4.6 万评分) | 美区付费榜新进 | 判死 | 国内白噪音早已免费覆盖 |
| 做任务换钱(免费榜 #2 / #5) | 美区免费榜 | 判死 | 国内网赚类已存在多年且被严管;且产品定义就是"要求你持续投入时间"——立法型 |
| AI 修图 / AI 视频 / 优惠券 | 美区免费榜新进 | 判死 | 国内对应品类全是红海 |
| 排练笔记($2.99,发布 2 天、0 个评分进付费榜前 50) | 美区付费榜新进 | 标本 | "榜位 ≠ 量级"的第 N 次实证 |
| 小硬件爆款(捏捏玩具 / 假警报灯 / 猫饮水机 / 磁吸眼镜架) | 短视频平台 | 判死 | 三关全过不了——全部是情绪消费,没有一个"省力" |
09-24 → 09-30(一手,官方榜单接口逐字对照):
含义:付费榜不是"发现需求"的地方,是"确认长住户"的地方。
免费榜前 100:新进 13 个、跌出 13 个。
跌出的 13 个里有 3 个是短剧出海 App。这和我拿到的行业信息对上了:其中一家的 iOS 版在 9/26 被下架(原因未公开),从业者同时警告平台正在收紧内容审查,并把这个品类类比于当年的社交与互动阅读——那两个品类最后大量被下架。
含义:同一个"榜",两张面孔。付费榜是养老院,免费榜是流动摊。
本期在海外短视频平台看到的主流省钱内容是:不花钱挑战(每天/每周砍掉非必要消费)· 把借记卡冻进冰块(想买东西得先等它化开)· 把信用卡当借记卡用 · 数码优惠券 · 穿自己衣柜(不买新的,重新搭配)。
注意前两条的共同形状:它们都是"给自己制造摩擦"。
把卡冻进冰块,本质是"不让你用工具"。
当需求的方向是"少用工具"时,"做一个更好的工具"这个动作本身就和需求相反。
近期的爆款小硬件:一块 $12 的奶酪捏捏(30 天 1.7 万件)、一盏 $10 的假太阳能警报灯(它其实不工作,只闪灯,一周 9117 件)、一个 $8.99 的狗狗换脸捏捏、猫饮水机、磁吸眼镜架。
共同点:低价 · 视觉反差或 ASMR · 近 100% 靠短视频与达人矩阵 · 卖情绪,不卖功能。
含义:能打的不是"货",是"视频"。 上面这些产品里,没有一条的壁垒在产品工艺上——全部在内容生产上。
⚠️ 限定:以上硬件数据全部来自趋势聚合站与媒体转述,我没有核验原始视频与后台。能当方向用,不能当决策依据用。
上期有一款相机 App 被列为唯一活口,并定下了结案条件:① 是否连续在榜 ② 评分数是否从两位数涨到三位数。
| 期 | 榜位 | 评分数 |
|---|---|---|
| 上上期 | #12 | 19 |
| 上期 | #8 | 21 |
| 本期 | #9 | 22 |
判定:连续在榜 ✅ · 评分数涨到三位数 ❌ → 按上期自己定的规则,本期不坐实。
它额外给出一个上期没料到的东西:它没掉下去。 三期下来榜位在 #8–#12 之间小幅移动。这不该读成"需求在起",也不该读成"需求死了"——它更像付费榜的长住户。
| 上游 | 下游 |
|---|---|
| 一家把新模型定到旗舰的 1/5 价,缓存命中再砍一半 | 美国 9 月消费者信心 81.9,12 年最低 |
| 一家出了半价的中档模型 | 个人储蓄率 3%,四年低位 |
| 一家语音模型 −95%、音频 −98% | 56% 美国人称日常更不可负担 |
| 一家把单个任务成本压到 $0.13 | 39% 用信用卡买食品 / 必需品 |
| 一家市值蒸发 80%,靠"低价"的那张牌被掀掉 | 近 60% 家庭月光 |
表面上是同一个方向:都在往"便宜"走。 但性质相反:
这两条线如果继续同向,会撞出一件事:
上游正在把"智能"变成标品;而下游省的不是 AI 的钱,是生活的钱。
⚠️ 限定:宏观数字来自多个机构的调查报道,口径与统计周期不完全一致——只能当方向证据,不能当同一时点的严格对照。
| 期 | 官方口径 | 第三方实测 |
|---|---|---|
| 第03期 · A | 每任务成本 −40% | 持平 |
| 第03期 · B | 未提价 | 每任务 +40~45% |
| 第03期 · C | −50% 单价 | −47%(真降) |
| 第04期 · D | 每任务成本最多降 30% | 每任务 $7.60,比上代高约 50% |
前三例的差异是"幅度",本期的差异是"符号"。
实际含义只有一句:换哪家不是主要变量,"让它少写"才是。
⚠️ 限定必须带上:这是第三方在标准测试集上的每任务成本,不是任何具体业务的账单。你自己的任务结构不同,结论方向可能不同——但"要按任务算而不是按单价算"这条方法论是不变的。
我给自己留过一条自查命令:定期跑一次,看某个东西有没有变。
这周我去跑它,终端回我的不是结果,是一行 Usage:——这条命令已经不存在了。
检查动作是会腐烂的。 它不像代码会报错,它只是某天开始查不到东西。 而"查不到"和"没问题",在输出上长得一模一样。
一个检查动作最危险的时刻,不是它报出问题的那一刻,是它开始报不出东西、而你还没发现的那一刻。
给读者的动作:你给自己设的每一个自查,都值得加一句"我怎么知道它还在正常工作"。
二手信息绝大多数不是编的。它的杀伤力恰恰来自"是真的"——所以你会直接采信,不会去问那个关键问题。
四个动作:① 问主语 ② 问量级 ③ 跑探针 ④ 问这个数回答的是谁的问题。
我怎么做的:上游部分用公开信息交叉核对,宣传口径与真实能力分开写;榜单部分全部是本机实测,不引用二手结论;"假阳性"和"抓不到"都如实写出来。
你可以自己验的:
如果你验出来跟我写的不一样,那份不同本身就是值得写下来的东西。
本报告的数据采集窗口:2026-09-24 ~ 09-30 · 榜单与探针数据采集于 2026-09-29 / 09-30 "三道门实测"一栏的口径于 2026-10-01 修正(直连改为显式不走代理),修正后重采一次,全文按修正后的数据写 下一期:2026-10-07