每日 AI 情报
SageMaker 同日上线前缀感知路由和 HyperPod 模型缓存,把重复 prefill 与冷启动等待变成可直接验收的成本项;Marengo 3.0、Quick 桌面版与 Skild S1 分别打开媒体检索、企业连接器和机器人示范数据服务。目标交易样本仍为空,本期只收运行证据,不外推旧行情。
公开 AI 机会情报
01Amazon SageMaker 前缀感知路由|长上下文 P50 首 token 延迟最高下降 77%
AWS 于 9 月 10 日为 SageMaker 实时推理端点上线
PREFIX_AWARE路由,让相同提示词前缀尽量落到同一实例并复用 KV cache。官方在 7 台ml.p5.48xlarge、Llama 3.1 70B 与 vLLM 上跑了 16 组配置;8,000-token 共享前缀持续一小时的测试中,P50 TTFT 下降 71%–77%、P90 下降 33%–37%、缓存命中率从约 25% 升至 82%、吞吐提升 15%–16%,路由本身增加 1.3–1.9ms。→ 为什么现在:这是目标日可直接配置到生产变体的新增路由策略,不需要改模型容器,并支持 OpenAI 兼容接口的
prompt_cache_key做租户隔离。→ 今天能做什么:用 ≤2 小时在获授权的双实例测试端点回放 200 条脱敏 RAG 请求,对比
RANDOM与PREFIX_AWARE的 P50/P90 TTFT、KV 命中、吞吐、溢出和租户串线;产出路由矩阵。成功信号是长前缀 P50 至少改善 30%、租户 key 零串线且热点实例不过载。→ 怎么变现:可卖“共享前缀流量审计 + 路由迁移验收”,用更高缓存命中压低重复 prefill 的 GPU 成本,并把租户隔离和过载回退写进交付合同。相关链接:SageMaker 前缀感知路由发布与基准 ↗
02Amazon SageMaker HyperPod 模型缓存|600GB+ 权重的扩容等待可从 30 分钟级缩到秒级启动
AWS 于 9 月 10 日为 HyperPod Inference 发布模型缓存,可在调度前把权重预载到本地 NVMe、把推理镜像预拉到节点。官方称本地读取约 7GB/s;57–145GB 模型的权重缓存基准让扩容约快 60%,镜像缓存相对每次从 ECR 拉取最多减少 97% 的等待,而 600GB+ 的 DeepSeek-R1 原本仅权重下载就可能超过 30 分钟。
→ 为什么现在:目标日新增的
modelCacheConfig同时覆盖 S3、FSx for Lustre、Hugging Face Hub 与 JumpStart,且为缓存就绪、健康、版本切换和清理提供可观察状态。→ 今天能做什么:用 ≤2 小时在隔离的 HyperPod 测试部署对一个 57–145GB 获授权模型做冷启动、同节点重启和扩容各一次;产出 image pull、weight load、ready time、NVMe 占用、cache state 与回源表。成功信号是重启/扩容命中缓存、ready time 至少缩短 50%,更新模型路径后旧缓存被清理。
→ 怎么变现:可卖“模型缓存容量规划 + 扩容演练”,减少突发流量时付费 GPU 等待、超时退款和重复下载,也能提前拦下 NVMe 不够或旧权重未刷新。相关链接:HyperPod 模型缓存发布与配置 ↗
03Amazon Bedrock Knowledge Bases × Marengo Embed 3.0|视频、音频、图像与文本进入同一 512 维语义检索
AWS 于 9 月 10 日宣布 TwelveLabs Marengo Embed 3.0 在 Bedrock Knowledge Bases 正式可用。托管知识库可直接摄取 MP4/MOV、JPEG/PNG 及音轨,自动做分段、抽帧、转写与统一 512 维嵌入,并返回片段起止时间和来源;首发区域为
us-east-1与us-west-1。→ 为什么现在:过去要自行拼接转写、抽帧、向量库和时间轴同步,目标日开始可用同一个托管检索接口完成,并可接到 Bedrock Retrieve API 或 AgentCore Gateway。
→ 今天能做什么:用 ≤90 分钟上传一段 10 分钟、权利清晰的双语视频,建立 4 秒默认分段的测试库并准备 20 个“画面 + 语音 + OCR”查询;产出 Recall@5、时间码偏差、跨语言命中、索引耗时和调用账单。成功信号是至少 16/20 个查询在前五项命中,关键片段时间码偏差不超过一个分段。
→ 怎么变现:可卖“跨境媒体资产可搜化 POC”,按已索引小时数、验收查询集和权限边界收费,替客户省去多段管线集成与后续维护。相关链接:Bedrock × Marengo 3.0 正式可用 ↗ · Marengo 3.0 模型说明 ↗
04Amazon Quick 桌面版|企业 agent 在 macOS 与 Windows 正式可用并接入统一活动流
AWS 于 9 月 10 日宣布 Amazon Quick 桌面应用正式可用,覆盖 macOS 与 Windows;移动端新增聚合邮件、日历、CRM 与消息的活动流,桌面和移动端同步聊天与文件夹,后台 agent 可在设备关闭后继续执行。官方同时给出 CloudWatch 与 CloudTrail 审计链,并列出 HIPAA、FedRAMP、SOC 2 与 ISO 27001 合规能力。
→ 为什么现在:Quick 从预览进入桌面 GA,跨设备续跑与统一待决队列使“谁能接哪些企业数据、哪些动作必须人工确认”成为上线前的直接采购问题。
→ 今天能做什么:用 ≤2 小时在一个获授权测试租户接入一套低风险日历与文档源,完成 10 个读取/写入/后台续跑任务;产出 connector scope、审批、CloudTrail/CloudWatch 事件、撤销和残留数据表。成功信号是 10/10 动作均可追溯,写操作必经既定审批,撤销后无越权残留。
→ 怎么变现:可卖“Quick 桌面接入前检 + 连接器验收”,帮跨境团队在采购席位前验证地区、权限、审计与后台任务边界,减少影子 AI、错配席位和售后争议。相关链接:Amazon Quick 桌面版 GA ↗ · Amazon Quick 产品页 ↗
05Skild AI S1|一段示范视频让机器人执行最长 10 分钟的新任务
NVIDIA 于 9 月 10 日披露 Skild AI S1 的部署细节:操作员用单段视频提示机器人,无需为新任务更新权重或专项后训练;公开测试包含最长 10 分钟的多步任务,一次盆栽测试从录制示范到硬件自主执行用时 11 分钟。Skild 报告每步成功率约 66%,对照系统为 9%,并估算一段短视频可替代约 380 个手工示范样本、节省 50–100 小时采集。
→ 为什么现在:目标日还披露了 60+ 部署合作和首个商业部署后 10 个月达到 1 亿美元年化收入,说明“视频到机器人任务”的采购从演示进入可量化交付。
→ 今天能做什么:用 ≤2 小时把客户的一条非危险、可重复工序拆成 8–12 个步骤,制作示范视频规范与失败恢复评分表;产出镜头、对象、动作、完成条件和人工接管点。成功信号是客户能用同一表复现三次示范,且每一步都有可观测验收与安全停机条件。
→ 怎么变现:可卖“机器人视频示范数据包 + 上线验收设计”,先用低成本流程拆解判断是否值得进入 S1/Isaac/Cosmos 交付,避免直接购买硬件与算力后才发现任务不可测。相关链接:NVIDIA:Skild AI S1 部署与基准 ↗
AI 基础设施交易情报
SageMaker 实时推理与 HyperPod 缓存|44 天无新增端点、GPU 或容量成交证据
9 月 10 日目标样本为 0。供需情况分析:新增 SageMaker/HyperPod 买方询盘、AWS 账号或额度供给、GPU 时段、托管交付和售后责任记录均为 0,供需强弱未知。产品以及价格/容量线索:7 月 29 日至 9 月 10 日共 44 个日历日,其中 42 个为已校验空样本日、2 个缺失;新增实例型号、区域、配额、endpoint、GPU-hours、TTFT、KV 命中、NVMe、冷启动、买方出价和供方要价字段均为 0。公开的 7×P5 路由基准和 57–145GB 缓存基准不是可售容量或成交价。热点议题:账号归属、区域与配额、至少双实例、
prompt_cache_key租户隔离、缓存版本、回源、NVMe 占用、账单和故障赔付需在同一部署回勾。→ 为什么现在:目标日同时新增前缀路由与模型缓存,但本地盘面没有证据证明哪条线路已开通、能跑多少或成本如何。
→ 交易判断 / 今天动作:收一份最小授权运行证据,不预付扩量;样本必须包含账号/区域、endpoint、实例、配额、200 个 request ID、命中率、TTFT、cache state、GPU-hours 和账单。
→ 怎么省钱:把“功能已发布”与“账号真有配额且成本可复现”分开,避免为不可用区域、空配额或冷启动等待买单。相关链接:前缀感知路由 ↗ · HyperPod 模型缓存 ↗
Bedrock × Marengo 3.0 多模态知识库|44 天无新增区域、调用或媒体索引订单
供需情况分析:新增 Bedrock 多模态检索买方需求、Marengo 模型访问、媒体索引代建、区域账号与可追责交付均为 0,不能判断需求或供给方向。产品以及价格/容量线索:新增
us-east-1/us-west-1访问、视频小时数、分段长度、512 维向量量、索引时长、Retrieve 调用、存储、买卖报价和账单字段均为 0;官方按存储、检索和模型调用计费的说明不等于任一渠道报价。热点议题:媒体权利、跨境存储、S3/SharePoint/Confluence 权限、转写语言、时间码、删除、账单归属与检索质量需要同一测试库证据。→ 为什么现在:Marengo 3.0 在目标日进入 Bedrock 托管知识库,但仅开放两个美国区域,访问与数据驻留都需逐租户验证。
→ 交易判断 / 今天动作:收一个 10 分钟授权媒体样本及 20 条验收查询,只接受带 region、KB ID、source URI、sync job、Retrieve 结果、删除记录和账单的交付证据。
→ 怎么省钱:先用小样本测索引与检索质量,再决定是否迁移大库,避免因区域不可用、授权不清或低命中率重复搬运。相关链接:Bedrock × Marengo 3.0 ↗
Amazon Quick 桌面与企业连接器|44 天无新增席位、租户或接入服务样本
供需情况分析:新增 Quick 买方询盘、可用租户、席位供给、连接器实施和审计售后均为 0,无法判断采购热度。产品以及价格/容量线索:新增地区、许可档位、席位数、后台任务时长、连接器范围、CloudTrail/CloudWatch 事件量、买卖报价和续费责任字段均为 0;桌面版 GA 与合规认证不代表任一来源能合法转售席位或代持租户。热点议题:身份归属、数据驻留、读取/写入 scope、人工审批、设备关闭后续跑、移动端待决队列、日志保留、撤销和离职回收需逐项验证。
→ 为什么现在:目标日从预览进入桌面 GA,跨设备执行把账号、连接器和后台动作责任推到采购前台。
→ 交易判断 / 今天动作:只收目标组织自有租户的授权试用样本;要求地区、许可、connector scope、10 个任务的审批/审计事件、撤销记录与账单责任齐全,不接代持身份。
→ 怎么省钱:先验证席位与连接器边界再扩采购,可减少闲置许可、越权写入、日志缺口和离职账号带来的处置成本。相关链接:Amazon Quick 桌面版 GA ↗
Skild S1 / NVIDIA 机器人栈|44 天无新增硬件、算力或交付工序样本
供需情况分析:新增机器人基础模型买方询盘、S1 访问、Isaac/Cosmos 算力、硬件供给、集成商交付和售后边界均为 0,无法判断供需方向。产品以及价格/容量线索:新增机器人型号、相机、任务时长、示范数量、逐步成功率、恢复次数、GPU-hours、现场工时、买卖报价和验收责任字段均为 0;公开的 66% 每步成功率、60+ 合作与收入数字不是任一客户工序的交付承诺。热点议题:单步成功率会在长链路中累乘,示范视频质量、对象变化、错误恢复、人工接管、现场安全、数据复用授权与硬件兼容必须拆开验收。
→ 为什么现在:9 月 10 日首次给出 S1 从一段视频到 10 分钟任务的具体部署数字,但交易侧没有可回查的机器人或算力订单。
→ 交易判断 / 今天动作:先收工序,不收硬件预付款;要求一段授权示范、步骤表、机器人/传感器清单、三次复现、失败与接管日志,再判断是否找集成供给。
→ 怎么省钱:把不适合视频提示、不可安全复现或难以定义成功的工序挡在采购前,减少硬件闲置、现场返工和事故售后。相关链接:Skild AI S1 部署与基准 ↗
今日可执行项
今天可试
- 前缀路由 A/B:≤2 小时,双实例测试端点回放 200 条脱敏 RAG 请求;产出 RANDOM/PREFIX_AWARE 的 P50/P90 TTFT、命中、吞吐、溢出和租户串线表;长前缀 P50 至少改善 30%、零串线且无热点过载即通过。
- HyperPod 缓存:≤2 小时,对一个 57–145GB 授权模型跑冷启、同节点重启与扩容;产出 pull/load/ready/NVMe/cache state 表;重启/扩容 ready time 至少缩短 50%,换版本后旧缓存清理即通过。
- Marengo 视频检索:≤90 分钟,用 10 分钟授权双语视频与 20 个跨模态查询建测试库;产出 Recall@5、时间码偏差、跨语言命中、索引时长和账单;≥16/20 命中且偏差≤一个分段即通过。
- Quick 连接器审计|2h:在自有测试租户跑 10 个读取/写入/后台续跑任务;产出 scope、审批、CloudTrail/CloudWatch、撤销与残留数据表;10/10 可追溯、写操作必审批且撤销无残留即通过。
- Skild 工序可测性包|2h:把一条非危险工序拆成 8–12 步并制作三次示范;产出镜头、对象、动作、完成条件、失败恢复与接管点;三次示范一致且每步可观测即通过。
需要跟进
- 核 SageMaker 区域、实例配额、PrefixLength/ConcurrencyThreshold、KV 指标与多租户隔离。
- 核 HyperPod 首次缓存填充、NVMe、缓存健康、模型路径版本化、回源和删除清理。
- 核 Marengo 两区访问、媒体格式与语言、检索质量、数据驻留、删除闭环和账单。
- 核 Quick 地区、许可、连接器 scope、后台任务、审计保留与离职回收。
- 核 S1 硬件兼容、逐步成功率、恢复、现场安全、数据授权和集成报价。
- 下一份非空样本优先补 endpoint/cache/GPU、KB/sync、Quick 席位/审计和机器人任务/硬件字段。
暂缓观察
- 不把 7×P5 官方基准外推到其他模型、区域或中转端点。
- 模型尺寸、NVMe、首次填充、版本刷新和回源未演练前不为缓存扩容。
- 不把 Marengo GA 写成全球可用;两个美国区域之外先核访问与数据驻留。
- 身份、地区、许可、写权限和审计未对齐前不采购或代持 Quick 席位。
- 客户工序、风险等级和逐步验收未定义前,不因 S1 公开成功率购买硬件。
- 当前交易证据不足,不发布账号、Key、号码、IP、池子、倍率、席位、GPU 或容量方向。
风控 / 政策动态
- 行情证据:9 月 10 日目标样本为 0;距最后非空记录 44 天,区间含 42 个已校验空样本日与 2 个缺失日,只补证,不报行情。
- SageMaker 前缀路由的收益高度依赖流量形状:官方长前缀结果来自固定 7×P5、Llama 3.1 70B 与 vLLM;短上下文吞吐仅提升 1.7%–2.0%。至少需要双实例,序列化差异会破坏路由一致性,PrefixLength 太短会制造热点、太长会打散命中;多租户必须带隔离 ID。相关链接:发布与限制 ↗
- HyperPod 缓存不是零成本且不会自动识别原路径内容变化:首次填充仍要完整下载,每个节点保存独立副本并占用有限 NVMe;若同一 S3 路径直接替换权重而不改部署规格,旧缓存可能继续被使用。上线前固定版本路径、容量阈值、健康与回源告警。相关链接:缓存限制与清理 ↗
- Marengo 3.0 首发只有两个美国区域:媒体上传前应确认著作权、人物隐私、跨境存储、连接器读取范围、转写内容保留与删除;厂商基准和 512 维存储效率不能替代目标语料的检索验收。相关链接:区域与计费说明 ↗ · AWS 责任共担模型 ↗
- Quick GA 与合规认证不等于所有数据和动作都可自动开放:先核组织自有身份、地区、许可、connector scope、人工审批、设备关闭后的任务控制、CloudTrail/CloudWatch 日志、数据删除与离职回收;不以代持租户绕过组织治理。相关链接:Quick GA ↗ · AWS 服务条款 ↗
- S1 的逐步成功率不能直接当长任务成功率:机器人动作涉及人身、设备与现场环境,66% 每步结果来自厂商公开测试,不能外推到客户工序;必须设置安全停机、人工接管、示范数据授权和事故责任边界。相关链接:S1 公开部署数据 ↗ · NVIDIA 服务条款 ↗
- 账号、邮箱、号码、IP、KYC 与支付只支持合规诊断:不支持批量注册、绕过验证、支付风控规避、越权安全测试或自动化退款;所有价格、倍率与容量只作市场观察,本报告不构成 AIRelay 报价、库存承诺、法律意见或可用性承诺。
一句话总结 / 今日提醒
9 月 10 日最值得收费的是 SageMaker 的前缀路由与 HyperPod 缓存验收、Marengo 媒体检索 POC、Quick 连接器前检和 Skild 工序数据包;交易侧因 44 天证据间隔继续只收运行证据、不报行情。