AIRelay
第 79 期 · 2026-07-21
DAILY AI INTEL

AIRelay 每日 AI 情报

2026-07-21 周二公开机会 + 基础设施交易

Qwen-Image-3.0 与 Gemini 新 Flash 档位把多语种内容和高吞吐任务推到可量化验收;交易侧则同时出现 F5/20x 池紧张、替代 coding 模型升温与支付封控风险上行。

Qwen 多语种视觉Gemini 成本分层F5 / 20x 池分级Grok / Kimi / GLM 路由支付与 IP 封控

公开 AI 机会情报

只保留目标日有具体发布、数字或公开讨论催化的主体。

01

Kimi Work 在 7 月 21 日把本地文件、浏览器操作和定时任务装进同一个桌面 agent

Kimi Work 官方页已开放 macOS Apple silicon 与 Windows 下载,功能包括挂载本地目录、WebBridge 浏览器自动化、内置 Cron、Python/Shell 后台任务、agent swarm,以及把结果转成 PPT/Excel;当天公开开发者讨论约 657 points / 268 comments。

为什么现在:AIRelay 读者原本要分别采购模型、浏览器自动化、定时脚本和文档工具,7 月 21 日的新催化是这些能力进入一个可直接安装的桌面入口,交付重点随即从“能不能跑”变成“哪些目录、网页和命令可以授权”。

AIRelay 读者今天能做:2 小时内在一个临时工作目录里配置“每天汇总 5 个官方模型页并生成一份采购变化表”,只开放该目录和 5 个域名,记录 Cron、浏览器动作、文件写入和人工确认;成功信号是定时任务能产出可复核表格,且未访问白名单外文件。

对读者意味着:可卖 Kimi Work 安装、权限边界、定时情报流和验收凭证,钱点在替客户省掉重复采集时间,同时减少本地文件误改和自动化售后。

相关链接www.kimi.com/products/kimi-work / news.ycombinator.com/item?id=48981703

02

Qwen-Image-3.0 在 7 月 21 日把生图从“好看”推到 4.5k 指令、10px 小字和 12 语种交付

Qwen 团队当天发布 Qwen-Image-3.0,官方页写明支持最高约 4.5k token 输入、约 10px 小字、12 种语言、100+ 风格,并把报纸 PDF、短剧分镜、复杂 UI 和知识信息图列为重点场景;当天公开讨论约 477 points / 193 comments。

为什么现在:跨境电商和 AI 接入卖家最花钱的不是出一张图,而是中文、英文及其他语言的小字、布局、事实和品牌细节反复返工。

AIRelay 读者今天能做:2 小时内固定 12 个任务,覆盖中英双语产品页、三语海报、9 宫格信息图和一次局部编辑,记录小字可读率、事实错误、版式、修改次数和人工修图分钟数;成功信号是至少 8/12 张无需重排就能进入人工校对。

对读者意味着:可卖多语种营销图、信息图和视觉验收包,钱点在减少设计返工,并把“模型入口”升级成按批次交付的内容生产服务。

相关链接qwen.ai/blog?id=qwen-image-3.0 / news.ycombinator.com/item?id=48989701

03

Gemini 3.6 Flash 与 3.5 Flash-Lite 在 7 月 21 日给高吞吐 agent 重新划出成本档位

Google 当天上线 Gemini 3.6 Flash 与 3.5 Flash-Lite;官方称 3.6 Flash 相比 3.5 Flash 少用约 17% 输出 token,公开价为每百万输入/输出 token 1.50/7.50 美元;Flash-Lite 约 350 output tokens/s,公开价为 0.30/2.50 美元,并已进入 Gemini API 与企业平台。

为什么现在:交易侧正在同时追万级 RPM、低倍率和多模型 coding 路由,7 月 21 日出现了可直接对照的官方速度、价格与可用入口,买家可以从“哪个模型最强”转向“哪类任务该放到哪个成本层”。

AIRelay 读者今天能做:2 小时内选 100 条脱敏票据/商品字段抽取任务和 10 条复杂 agent 任务,用现有入口、Flash-Lite 与 3.6 Flash 分层跑,产出单任务成本、字段准确率、重试率、首字和工具调用表;成功信号是高吞吐批次成本下降至少 20%,且字段准确率不低于既有基线。

对读者意味着:可卖 Gemini 路由迁移、批处理成本表和按月用量优化,钱点在压低重复任务 token 成本并留出更高毛利。

相关链接blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/ / ai.google.dev/gemini-api/docs/latest-model / news.ycombinator.com/item?id=48993414

04

Cursor 在 7 月 21 日的 agent swarm 成本实验把“贵模型做规划、便宜模型做执行”量化到 1,339–10,565 美元

Cursor 公开了同一 SQLite-from-scratch 任务的多组实验,新 swarm 在所有模型组合最终通过完整测试;不同组合总成本从约 1,339 美元到 10,565 美元,worker 至少消耗 69% token、多数配置超过 90%,而 GPT-5.5 全量 worker 约 9,373 美元,对比 Opus 4.8 规划 + Composer 2.5 执行的 worker 约 411 美元。

为什么现在:7 月 21 日公开讨论约 260 points / 131 comments,催化点不再是“多 agent 很酷”,而是同样质量下模型分工能造成接近一个数量级的成本差。

AIRelay 读者今天能做:2 小时内把一个 20 步非生产 coding 任务拆成 planner、worker、reviewer 三类,给每类设模型、token 上限、失败回退和测试门槛,做一次全前沿模型与混合模型 A/B;成功信号是测试全绿、人工接管不增加,同时成本下降至少 30%。

对读者意味着:可卖 agent 任务分解、模型混编和成本闸门,钱点在把昂贵模型留给决策节点,把大部分执行 token 转到更便宜的通道。

相关链接cursor.com/blog/agent-swarm-model-economics / github.com/cursor/minisqlite / news.ycombinator.com/item?id=48982535

AI 基础设施交易情报

脱敏后的供需、容量、价格方向、验真字段与当天动作。

01

Claude Max / CCMax / GPT Pro 池|需求强于可核验供给,F5 额度、封号与库存价格同时分叉

供需情况分析:按本期固定口径,7 月 21 日 pool/code 脱敏样本约 33 条,高于 7 月 20 日约 21 条;买方动作约 11、供方动作约 4、风险触发约 9。买方连续找 F5 CCMax、CCMax 账号/速刷号/质保号和 GPT 订阅号,供给侧出现 0.5x 池但 Fable 5 额度接近耗尽、0.8 满血/F5 口径与小额账号批量供给,属于需求强于可核验供给。产品以及价格/容量线索:0.5x/0.8、F5 额度很少、十万刀左右、20x、5 小时额度、1.7 折/2.4 折分别是供方 ask、名义容量、计划/窗口和分销层级观察;同日出现换 IP 挂反代后约一天封控、Pro20 封号退款和 GPT Pro 额度体感异常。热点议题:App Store/礼品卡订阅与批量注册号的寿命是否不同,F5 是否真可用,5 小时/周限能否复测,IP/反代是否放大封控,封号退款与账号来源由谁负责。交易判断/今天动作:挂隔离测试池并拆成“可连续交付 / 临时余量 / 高风险账号”三层;只收带计划、到期、F5/模型目录、5 小时/周限、RPM/429、IP/代理环境、24 小时与 7 天复测、封号和退款边界的样本。钱点在稀缺池分级与售后减损,避免低倍率收入被封控、重测和退款吃掉。证据:脱敏聚合 #pool-0721

相关链接support.claude.com/en/articles/11145838-use-claude-code-with-your-pro-or-max-plan / support.claude.com/en/articles/8241253-safeguards-warnings-and-appeals

02

OAI T4–T5 / Kimi K3 千万 TPM / Claude 小额官 key|买方动作约为供方四倍,大容量与小额库存同时缺口

供需情况分析:official-key/capacity 脱敏样本约 8 条,略低于前日约 10 条,但买方动作约 4、明确供方约 1;需求包含跑 GPT-5.6 Sol 的 OAI T4–T5 官 key、Kimi K3 约 1,000 万 TPM,以及 Claude 小额官 key,供给侧只有零散小额/限时折扣口径,属于需求强于供给。产品以及价格/容量线索:T4–T5、GPT-5.6 Sol、1,000 万 TPM、5 美元小额 key、1 折限时口径分别是账户层级、目标模型、买方容量门槛、库存规格和促销 ask;它们不能互相替代,也不能用一张余额截图证明持续供给。热点议题:真实 org/project 与模型 ID 是否一致,千万 TPM 是否还受日限约束,小额 key 是否可追责,限时折扣结束后账单如何变化,官 key 与 routed endpoint 能否区分。交易判断/今天动作:找供给并要账单/额度证明;分别建立“小额测试 key / 中型生产 / 千万 TPM”三档,保留 org/project、base URL、model ID、rate limit、usage、request id、余额变化与 24 小时复测。钱点在容量分档采购和主体尽调,少让客户为“官 key / 大额度”口号预付后才发现模型或日限不符。证据:脱敏聚合 #keycap-0721

相关链接developers.openai.com/api/docs/guides/rate-limits / platform.moonshot.ai/docs/guide/start-using-kimi-api / platform.claude.com/docs/en/api/rate-limits

03

Grok / Kimi / GLM 加入 coding 路由|相关样本从约 3 条升到 12 条,新增点是替代模型进入真实选型

供需情况分析:7 月 21 日替代 coding 模型相关脱敏样本约 12 条,是前日约 3 条的 4 倍;买方与供方动作各约 3。当天出现“年初只能选 Claude/GPT,现在 Grok、Kimi、GLM 都能打”的选型讨论,也出现 Kimi K3 容量采购、Grok 订阅价询问、GLM 官 key 促销与多协议路由新增 Grok 支持,属于双边试探。产品以及价格/容量线索:Kimi K3 千万 TPM、Grok 订阅活动、GLM 限时官 key、OpenAI/Claude 双协议新增 Grok,分别是买方容量、订阅成本、促销和路由覆盖口径;“Claude 不再碾压”的反馈是选型假设,不是质量结论。热点议题:真实 model ID 是否透传,代码补丁能否过测试,中文/长上下文/工具调用各自强弱,协议转换是否丢工具调用,活动结束后成本与限流如何变化。交易判断/今天动作:做模型身份与五题质量基准,不先囤入口;固定 5 个 coding 任务,记录 model ID、测试通过率、usage、首字、工具调用、429/5xx 和 24 小时复测。钱点在把模型热度变成可收费 fallback 与任务路由,避免为假模型、短期促销或质量回退承担退款。证据:脱敏聚合 #codemix-0721

相关链接platform.moonshot.ai/docs/guide/start-using-kimi-api / docs.x.ai/docs/models / bigmodel.cn/dev/api/normal-model/glm-5

04

万级 RPM / 高缓存 / 逐笔明细 / GPT Pro 重连|盘面翻倍但风险密度更高

供需情况分析:route/observability 脱敏样本约 23 条,高于前日约 10 条;买方与供方动作各约 4、风险触发约 10,属于双边活跃但风险密度高。供给继续把官方价约 1.5 折、万级 RPM、高缓存、低延迟、逐笔明细、OpenAI/Claude 协议互调与新增 Grok 打包;需求侧则追问 Fable 5 上 key 和多模型入口,同日出现 GPT Pro 在 Codex 多人请求时频繁重连/断连。产品以及价格/容量线索:1.5 折、万级 RPM、高缓存、逐笔调用明细、双协议、Grok 支持,以及“单个 20x 日吞吐十亿级”的供方口径,分别是供方 ask、容量/可观测承诺和待验证上限;断连与当天支付异常说明短时广告参数尚未等于持续容量。热点议题:真实模型是否透传、cache hit 是否进入逐笔扣费、多人共用时会话如何隔离、重连是否重复扣费、万级 RPM 和十亿级吞吐能否在 4 小时稳态下成立。交易判断/今天动作:做 4 小时稳态复测和账单对账;固定 30 条请求与 3 个并发档,记录 model ID、request id、首字、cache hit、断连、重试、429/5xx、工具调用、扣费和余额变化。钱点在把低倍率入口升级成可查账 SLA,或在成交前筛掉无法追责的路由。证据:脱敏聚合 #route-0721

相关链接developers.openai.com/api/docs/guides/error-codes / platform.claude.com/docs/en/api/rate-limits

05

GPT/Claude 支付、IP/反代与教育邮箱|仅风险噪音,风险触发从约 10 升到 27

供需情况分析:account/payment 脱敏样本约 50 条,高于前日约 30 条;风险触发约 27、买方动作约 8、未识别到可安全验收的明确供给。当天集中出现卡拒付忽好忽坏、GPT 付款大面积失败、App Store/礼品卡续费原本一周正常但换家宽 IP 挂反代后约一天封控、批量注册账号被怀疑重点风控,以及教育邮箱速刷来源不可持续,属于仅风险噪音。产品以及价格/容量线索:App Store/礼品卡、家宽 IP、反代、批量注册、教育邮箱、拒付、续费与封控时间线都是环境与生命周期字段,不是可单独出售的稳定能力;“换姿势支付 / 速刷 / 退费”不能当交付方案。热点议题:问题来自卡 BIN/3DS、Stripe 风控、付款主体、IP 信誉、设备指纹、批量注册还是代理行为,支付成功后是否仍会追封,退款和账号所有权如何拆。交易判断/今天动作:暂不碰批量开号、速刷与绕验证;只做合规环境诊断,记录账号/邮箱/号码所有权、付款方式、BIN/3DS 响应、IP/设备、客户端、错误页、封控时间线、申诉和退款路径。钱点在售前筛查与售后减损,少一次拒付、封号或退款争议就能保住毛利。证据:脱敏聚合 #payrisk-0721

相关链接docs.stripe.com/radar / openai.com/policies/terms-of-use / www.anthropic.com/legal/consumer-terms

今日可执行项

今天可试

  • Kimi Work 权限化定时情报流2 小时内在临时目录配置“每天汇总 5 个官方模型页并生成采购变化表”;产出域名白名单、目录权限、Cron、浏览器动作、文件写入与人工确认凭证,成功信号是能定时产出且没有白名单外访问。
  • Qwen-Image-3.0 多语种 12 题验收2 小时内固定中英产品页、三语海报、9 宫格信息图和局部编辑共 12 题;产出小字可读率、事实错误、修改次数与人工修图分钟数,成功信号是至少 8/12 张无需重排即可进入校对。
  • Gemini Flash 分层成本表2 小时内用 100 条字段抽取和 10 条复杂 agent 任务对比现有入口、3.5 Flash-Lite 与 3.6 Flash;产出单任务成本、准确率、重试率、首字和工具调用,成功信号是批次成本下降至少 20% 且准确率不降。
  • Cursor planner/worker 成本闸门2 小时内把一个 20 步非生产 coding 任务拆成 planner、worker、reviewer,设置模型、token 上限、失败回退和测试门槛;产出角色路由、账单与测试结果表,成功信号是测试全绿、人工接管不增加、成本下降至少 30%。
  • CCMax / GPT Pro 池三层入库2 小时内收一个 F5/20x/Pro 样本,补计划、到期、5 小时/周限、RPM/429、IP/代理、24 小时与 7 天复测和退款边界;产出连续交付、临时余量、高风险三层入库记录,成功信号是样本能明确归入其中一层。

暂缓观察

  • Fable 5 额度接近耗尽却仍按 0.5x 开池的样本没有批次、额度窗口、F5 模型、24 小时/7 天复测和退款记录前,不包装成稳定池。
  • 只报 1.5 折、万级 RPM、高缓存、十亿级日吞吐但不给逐笔证据的路由没有 model ID、request id、cache hit、断连、429/5xx、工具调用和余额变化前,不进入生产。
  • 教育邮箱速刷、批量注册、换支付姿势或绕验证来源、所有权、付款、KYC、封控恢复和退款边界不清,暂不碰。
  • Gemini 3.5 Flash Cyber 的转售或公开接入官方目前只计划向政府与可信合作伙伴开放有限试点,不把它写成可采购公共 API。

风控 / 政策动态

所有折扣、倍率、库存、TPM/RPM、缓存、吞吐、账号寿命、退款与官方模型公开价都只用于市场观察

这些不构成 AIRelay 报价或可用性承诺;本期未核验到 7 月 21 日新的明确账号或支付政策条款变更,交易侧异常必须逐样本复核。

Kimi Work 的“本地 agent”仍会操作本地目录、浏览器和 Shell

只在临时目录与脱敏资料上测试,限制域名、命令、写入范围、密钥、自动唤醒和人工确认;官方的“Ask before acting”不能替代自己的权限与日志验收。相关链接:www.kimi.com/products/kimi-work

Qwen-Image-3.0 的 10px 小字、12 语种和知识图能力仍需逐张人审

模型生成的公式、事实、商标、人物、素材授权和多语种文字不能直接进入客户广告或合规文件;保留 prompt、原图、修改记录和审批人。相关链接:qwen.ai/blog?id=qwen-image-3.0

Cursor swarm 的 1,339–10,565 美元成本差来自特定 SQLite 实验

它支持“planner/worker 分层值得测”,不支持承诺任何客户任务都能省同样比例;先固定任务、测试集、时间预算、模型版本和人工接管,再比较成本。相关链接:cursor.com/blog/agent-swarm-model-economics

CCMax/GPT Pro、官 key、路由和支付异常必须回到可追责主体与证据

账号计划、org/project、model ID、usage、request id、额度窗口、付款主体、IP/设备、错误响应、申诉和退款边界缺一项,就只进观察池。

一句话总结 / 今日提醒

7 月 21 日公开侧先抓 Qwen-Image-3.0 的多语种视觉验收、Gemini Flash 的高吞吐分层和 Cursor 的 planner/worker 成本闸门;交易侧先分级 F5/20x 池、核 OAI/Kimi 千万 TPM 主体,并暂停把卡拒付、教育邮箱速刷或换 IP 反代当成可交付能力。