AIRelay
第 81 期 · 2026-07-23
DAILY AI INTEL

AIRelay 每日 AI 情报

2026-07-23 周四公开机会 + 基础设施交易

Health in ChatGPT、GigaToken 与 Cactus Hybrid 把地区可用性、预处理成本和端云路由推到可验收层;交易侧则出现 CCMax 紧张买盘、支付/IP 风险翻倍与 128 台 B300 需求口径。

ChatGPT HealthGigaTokenHybrid confidenceCCMax 紧张池支付 / IP 风险B300 单位待核

公开 AI 机会情报

只保留目标日有具体发布、数字或公开讨论催化的主体。

01

Health in ChatGPT 在 7 月 23 日把健康数据连接变成一张地区、计划与权限验收表

OpenAI 当天开始向美国 18 岁以上登录用户在 Web 与 iOS 的 Free、Go、Plus、Pro 计划推出 Health,可连接 Apple Health 与受支持医疗记录;官方同时明确 Health 尚未进入 Codex,连接数据及使用这些数据的对话不用于训练基础模型或定向广告。

为什么现在:官方称每周已有超过 3 亿人向 ChatGPT 提健康问题,早测用户中超过 70% 的相关对话发生在专用 Health 空间之外;7 月 23 日的上线把“能否访问、何时调用敏感数据、什么数据不能跨边界”变成当天就会出现的售前与支持问题。

AIRelay 读者今天能做:90 分钟内做一张 Health Access Matrix,只列地区、年龄、客户端、计划、可连接数据源、逐次/长期授权、断开后删除窗口与人工升级边界;成功信号是一个医疗或健康类客户能在不上传真实记录的前提下判断“当前可用 / 等待地区开放 / 不应接入”。

对读者意味着:可卖地区可用性核验、连接前隐私清单与客服培训,钱点在减少错卖账号、跨区返工和敏感数据售后。

相关链接https://openai.com/index/health-in-chatgpt/

02

GigaToken 在 7 月 23 日把 tokenizer 吞吐推到 GB/s,并把训练数据预处理变成可单独验收的成本层

该开源项目当天进入公开开发者讨论,采集时约 591 points / 117 comments;项目在双路 AMD EPYC 的 11.9GB OpenWebText 测试上报告 GPT-2 吞吐 24.53GB/s、约为 Hugging Face tokenizer 的 989 倍,在 M4 Max 上报告 8.79GB/s、约 1,268 倍,并提供 Hugging Face / tiktoken 兼容模式。

为什么现在:跨境模型训练、批量计费预估与大语料清洗常把 tokenizer 当成免费前置步骤,7 月 23 日的具体基准提醒买家,CPU 机型、Python 传输开销与输出一致性会直接改变交付时长和机器成本。

AIRelay 读者今天能做:2 小时内拿 1GB 中英混合脱敏文本,在同一台机器比较现有 tokenizer、GigaToken 兼容模式与原生 API,产出 wall time、CPU、峰值内存、token 总数和 100 条输出 hash;成功信号是输出完全一致,且预处理时间至少下降 50%。

对读者意味着:可卖语料预处理加速、token 预算复核和训练前容量规划,钱点在少租 CPU、缩短交付等待,并减少“token 口径不一致”造成的账单争议。

相关链接https://github.com/marcelroed/gigatoken/ / https://news.ycombinator.com/item?id=49010167

03

Cactus Hybrid 在 7 月 23 日把“小模型不确定就上云”做成结构化 confidence 路由

项目当天以 Show HN 进入公开讨论,采集时约 179 points / 38 comments;首个 Gemma 4 E2B Hybrid checkpoint 会为每个回答返回 0–1 的 confidence,项目报告在若干文本、视觉与音频任务上只把约 15%–35% 请求交给 Gemini 3.1 Flash-Lite,就能匹配其多数基准表现,路由质量平均 AUROC 为 0.814。

为什么现在:近几期买家一直在算本地模型与云 API 的成本,但缺少“何时应该升级到更贵模型”的可验收信号;7 月 23 日的新催化是 confidence 不再从回答文本里猜,而是成为结构化字段。

AIRelay 读者今天能做:2 小时内拿 100 条脱敏客服/文档问答与 10 条陷阱题,以 0.85 为初始阈值比较全本地、全云和 hybrid 三路,产出本地命中、上云比例、错误拦截和单题成本;成功信号是至少 60% 普通题留在本地,且 10 条陷阱题中至少 8 条被升级或拒答。

对读者意味着:可卖端云混合路由、阈值校准与月度回归,钱点在保留高风险升级的同时减少云 token 支出。

相关链接https://github.com/cactus-compute/cactus-hybrid / https://news.ycombinator.com/item?id=49010782

04

恶意“面试作业”仓库在 7 月 23 日把 Git hooks 与 .vscode 自动执行变成供应商代码入场闸门

当天公开复盘显示,伪装成招聘作业的仓库把远程 payload 藏在 Git hooks 中,候选人运行 Git 命令即可触发;其他变体把命令放进 .vscode,仅打开目录就可能执行,相关公开讨论采集时约 434 points / 120 comments。

为什么现在:AIRelay 读者会让 Claude Code、Codex 或人工工程师接手客户仓库、插件和供应商 demo,7 月 23 日的案例证明“先 clone 再让 agent 看”本身就可能碰到凭证与本机文件风险。

AIRelay 读者今天能做:90 分钟内做一个 Vendor Repo Intake Gate,在无密钥临时虚机中静态检查 .git/hookscore.hooksPath.vscode/tasks.json.vscode/launch.json、package scripts、二进制文件与外连域名;成功信号是在执行任何 Git、IDE 或包管理命令前生成文件 hash、风险清单和阻断结论。

对读者意味着:可卖客户仓库接入预检、agent 沙箱入场券与事件复盘,钱点在避免一次凭证泄露、钱包/账号损失或整机重装吞掉项目利润。

相关链接https://citizendot.github.io/articles/fake-job-interview-git-hook-malware/ / https://news.ycombinator.com/item?id=49013036

05

新进展:GitHub Models 在 7 月 23 日进入退役前第二次 brownout,7 月 30 日将完全关闭

GitHub 官方时间表写明,7 月 23 日会让 Models 请求短暂返回错误;7 月 30 日后 playground、model catalog、inference API 与 BYOK endpoint 都不再可用,影响仍在使用的现有客户。

为什么现在:7 月 18 日我们只把它列为迁移倒计时,7 月 23 日的新变化是第二次故障演练已到当天,仍依赖该 endpoint 的工作流现在可以用真实失败窗口验证 fallback。

AIRelay 读者今天能做:2 小时内把 20 条脱敏固定请求分别重放到现有 GitHub Models、Microsoft Foundry/Copilot 或自有路由,产出 model ID、鉴权、endpoint、usage、错误码、切换开关和回滚负责人;成功信号是所有生产流程都有非 GitHub Models fallback,且客户端无需重新发布即可切换。

对读者意味着:可卖一周内的 endpoint 迁移、BYOK 重接与停机演练,钱点在避免 7 月 30 日后客户业务中断,并把一次性迁移转成持续路由维护。

相关链接https://github.blog/changelog/2026-07-01-github-models-is-being-fully-retired-on-july-30-2026/

AI 基础设施交易情报

脱敏后的供需、容量、价格方向、验真字段与当天动作。

01

Claude Max / CCMax / Fable 5 池|双边活跃,但 0.7x 买盘被认为难成交、0.8x–0.805x 与单号日消耗 30–50 美元成为新锚

供需情况分析:按同一关键词口径,7 月 23 日 pool/code 脱敏样本约 43 条,与前日约 39 条接近;CCMax 约 36 条、Fable 5 / F5 约 11 条。买方明确找可托管消耗的批量账号与 Max20x 供给,供给端虽有号池和套餐口径,但同时出现调用量近几日接近翻倍、号池供不上会报错的反馈,属于双边活跃但可连续交付库存偏紧。

产品以及价格/容量线索:买方 bid 从 0.7x 试探到 0.8x–0.805x,另有单号日消耗约 30–50 美元与批量 Max20x 需求;这些分别是收购上限、消耗能力与计划规格,不能代替账号年龄、Fable 5 目录、5 小时/周限和质保。

热点议题:0.7x 是否已脱离成交区、单号高消耗会不会加速封控、托管后报错由谁负责、F5 是否真实可用、24 小时与 7 天复测能否连续。

交易判断/今天动作:找供给并做池级入库,不直接扩客;只收能给计划、到期、模型目录、日消耗、RPM/429、5 小时/周限、24 小时/7 天复测和退款边界的样本。钱点在紧张库存的采购分级与托管服务,也在少赔一次封控、报错和退款。

相关链接https://support.claude.com/en/articles/11145838-use-claude-code-with-your-pro-or-max-plan / https://support.claude.com/en/articles/8241253-safeguards-warnings-and-appeals

02

Fable 5 / Max20x / Codex Pro20x 路由|供给强于需求,套餐倍率下调与“只要低倍率”买盘同时出现

供需情况分析:7 月 23 日 route/observability 同口径样本约 35 条,较前日约 37 条基本持平;买方动作约 6、供方动作约 9,供给略强。当天一条套餐把 Fable 5 分组调整为约 0.2x,同时列出不含 Fable 5 的 Max20x 约 0.1x、Codex Pro20x 约 0.06x;需求侧另找可承受 500 RPM 的 Plus / Pro 入口,并明确出现“低倍率优先于稳定”的选择。

产品以及价格/容量线索:0.2x、0.1x、0.06x 是单一供给套餐的 ask,不代表全盘价格;500 RPM 是买方最低容量门槛。同期还观察到 sub2 很快打满周限与账号接入路由后不到一天封控的反馈,低倍率可能把账号、重试和售后成本藏到下游。

热点议题:倍率是否包含缓存和失败重试、真实 model ID 是否透传、周限与单号池如何计算、路由接入是否放大封控、断路后能否定位到 request id。

交易判断/今天动作:做 4 小时稳态与逐笔对账;用 30 条固定请求和 3 档并发记录 model ID、request id、cache hit、429/5xx、重试、扣费、余额和封控时间线。钱点在把低倍率入口升级成可查账 SLA,或在成交前筛掉会被重试和售后吃掉的毛利。

相关链接https://developers.openai.com/api/docs/guides/error-codes / https://platform.claude.com/docs/en/api/rate-limits

03

支付 / IP / 封控 / 邮箱|仅风险噪音,同口径盘面约从 39 升到 91、风险触发从约 23 升到 35

供需情况分析:7 月 23 日 account/payment 盘面较前日翻倍以上,IP 相关约 38 条、封号约 17、邮箱约 11、注册与支付各约 7、退款约 5、KYC 约 4;买方主要在找能开户或不拒付的环境,供给侧没有形成可安全验收的稳定产品,属于仅风险噪音。

产品以及价格/容量线索:银行卡拒付、换 IP / 指纹仍失败、付款成功后立即封控、同批邮箱风险联动、退款扣费与支付渠道不退款,都是环境和生命周期证据,不是“换一个 IP/卡台就能解决”的商品。

热点议题:问题来自邮箱批次、IP 信誉、设备指纹、付款主体、卡 BIN / 3DS、代理行为还是上游风控;退款、申诉与账号所有权由谁负责。

交易判断/今天动作:暂不碰批量注册、绕验证和来源不明支付链路,只做合规环境诊断;一份样本必须写清账号/邮箱/号码所有权、IP/设备、付款响应、错误页、封控时间线、申诉和退款。钱点在售前筛查与售后减损,少一次拒付、封号或批量退款争议就能保住毛利。

相关链接https://docs.stripe.com/radar / https://openai.com/policies/terms-of-use / https://www.anthropic.com/legal/consumer-terms

04

Kimi K3 / GLM 5.2 / Gemini 路由|双边试探,K3 买方给出日消耗 2–3 万与 6.5 折上限,但供给承诺要等到 7 月 27 日后

供需情况分析:7 月 23 日替代模型同口径样本约 14 条,略高于前日约 12 条;Kimi、GLM、Gemini 同日出现买方和供方动作。K3 有明确需求与未来容量承诺,GLM 5.2 出现约 4.5 折供给口径,Gemini/Claude 则继续以万级 RPM 作为卖点,属于双边试探而非当天现货。

产品以及价格/容量线索:K3 企业速刷号、日消耗 2–3 万、6.5 折以下买方上限、7 月 27 日后“无限量”承诺、GLM 5.2 约 4.5 折与万级 RPM,分别是任务量、买方 bid、未来供给声明与供方 ask;未来日期和“无限量”都必须用官方主体、rate limit 与日限拆开。

热点议题:真实 model ID 与账单主体、活动结束后的成本、速刷号生命周期、协议转换是否丢工具调用、万级 RPM 是否能跑满 4 小时。

交易判断/今天动作:收样本但不预付、不囤入口;先要 7 月 27 日前后的 org/project、model ID、usage、日限、错误日志和 24 小时复测。钱点在把热点模型筛成可收费 fallback,也在避免为未来口头容量承担退款。

相关链接https://platform.moonshot.ai/docs/guide/start-using-kimi-api / https://bigmodel.cn/dev/api/normal-model/glm-5 / https://ai.google.dev/gemini-api/docs/rate-limits

05

NVIDIA B300|新增 128 台需求口径,但“台”对应 GPU、HGX baseboard 还是 DGX 系统尚未定义

供需情况分析:7 月 23 日首次出现一笔明确的 128 台 B300 采购需求,随后出现单台价格门槛讨论,但没有型号、交付地、序列号、保修或现货证明,属于需求先行、可核验供给为空。

产品以及价格/容量线索:NVIDIA 官方资料显示 DGX B300 是 8 张 Blackwell Ultra GPU 的 10RU 系统,总 GPU 内存约 2.3TB;HGX B300 与单张 B300 又是不同采购单位。私有口径里的“128 台”未说明单位,价格数字也缺货币与配置,不能直接比较。

热点议题:是单卡、8-GPU HGX/DGX 还是整机节点,是否含 NVLink / ConnectX-8 / DPU、机架电力与冷却,交付周期、区域出口、序列号和原厂保修如何证明。

交易判断/今天动作:先做采购规格卡,不询价放量;要求 BOM、形态、数量单位、机房条件、交付地、serial/warranty、验货与付款节点。钱点在高客单硬件尽调和供需撮合,先消除一个单位误差就能避免大额错单。

相关链接https://www.nvidia.com/en-us/data-center/dgx-b300/ / https://docs.nvidia.com/dgx/dgxb300-user-guide/introduction-to-dgxb300.html

今日可执行项

今天可试

  • Health Access Matrix90 分钟内把 Health in ChatGPT 的地区、年龄、客户端、计划、数据源、授权、断开删除与人工升级边界做成一页;产出可给客户的可用性表,成功信号是不用真实健康记录也能明确“可用 / 等待 / 不接入”。
  • GigaToken 一致性基准2 小时内用 1GB 中英混合脱敏文本比较现有 tokenizer、兼容模式与原生 API;产出 wall time、CPU、内存、token 总数和 100 条输出 hash,成功信号是输出一致且预处理时间下降至少 50%。
  • Cactus Hybrid 阈值卡2 小时内用 100 条普通题与 10 条陷阱题跑本地/云/hybrid 三路;产出上云比例、错误拦截、单题成本和 0.85 阈值,成功信号是 60% 普通题留本地且 8/10 陷阱被升级或拒答。
  • Vendor Repo Intake Gate90 分钟内在无密钥临时虚机静态检查 hooks、.vscode、package scripts、二进制与外连域名;产出 hash 与阻断清单,成功信号是在运行 Git、IDE 或包管理命令前完成判定。
  • B300 128 台需求规格卡2 小时内把采购单位、BOM、形态、数量、机房、电力/冷却、交付地、serial/warranty、验货与付款节点补齐;产出可发供方的 RFI,成功信号是先确认“单卡 / HGX / DGX”再进入询价。

暂缓观察

  • 非美国账号、Codex 或不受支持数据源强接 Health官方当前只向美国 18+ 用户在 Web/iOS 的指定计划推出,地区、客户端或数据源不匹配时不提供绕行方案。
  • 把 GigaToken 的 989x / 1,268x 写成所有机器的节省硬件、语料、API 模式与 Python 开销不同;没有输出一致性和本机基准前,不进入生产训练链路。
  • 只报低 confidence 就上云但不给阈值回归的 hybrid 路由没有错误样本、误拒率、上云比例与成本曲线前,不承诺节省或准确率。
  • 只报 0.7x–0.805x、500 RPM、“无限量”或 128 台而不给主体证据的资源没有账号/项目/模型/硬件单位、usage、错误日志、保修与复测前,不进入客户生产或大额预付。
  • 批量注册、恶意越狱、绕人机验证或来源不明的支付/邮箱/IP 链路不进入 AIRelay 交付,只保留安全分析与合规诊断。

风控 / 政策动态

所有折扣、倍率、库存、日消耗、RPM、账号数量、硬件数量与未来容量都只是市场观察

这些不构成 AIRelay 报价、可用性承诺、账号寿命保证或硬件现货证明;涉及价格与合规的免责声明集中在本节。

Health in ChatGPT 当前有明确地区、年龄、客户端与数据边界

只向美国 18+ 登录用户在 Web/iOS 的 Free、Go、Plus、Pro 计划逐步推出,尚未进入 Codex;健康信息要逐项授权、可断开,重要结论仍需医疗专业人员复核。 相关链接:https://openai.com/index/health-in-chatgpt/

GigaToken 与 Cactus Hybrid 的公开数字都来自项目方指定基准

989x / 1,268x tokenizer 加速、15%–35% cloud handoff 与 0.814 AUROC 适合提出测试假设,不代表任意硬件、语言、量化或客户任务;上线前必须保留输出 hash、阈值、错误样本和回滚。

CCMax、低倍率路由、K3/GLM 容量与 B300 大单都必须回到可追责主体

账号计划、org/project、model ID、request id、usage、额度窗口、硬件 BOM、serial/warranty、付款主体和复测缺一项,就只进观察池。

一句话总结 / 今日提醒

7 月 23 日公开侧先抓 Health in ChatGPT 的地区/权限验收、GigaToken 的预处理成本与 Cactus Hybrid 的 confidence 路由;交易侧优先分级 CCMax 紧张池、拆支付/IP 风险,并先把 128 台 B300 的采购单位问清,别为“低倍率、无限量或大单”口头口径提前压资金。