一个模型开无人机也开机器狗:Perceptron Mk1.5 宣称提速 2–5 倍,托管平台记录的是 P99 30.95 秒
同一模型不用重训就能管无人机、四足和眼镜,这个卖点很亮。但真正决定它能不能上本体的是另一组数字:端到端延迟中位数 2.79 秒,P99 30.95 秒,工具调用错误率 5.55%。
- 一个模型覆盖三类本体:Mk1.5 是单一具身智能体模型,面向无人机、四足机器人、智能眼镜及其他物理系统,无需为每个平台单独做一次重训。
- 上下文口径有两个:The Neuron 记为 32K 上下文,OpenRouter 模型页记为 37K——两个数字并列,报道未说明差异来源。
- 官方自报的提速:在同硬件下端到端比 Mk1 快约 2–5 倍;官方同时称在 4 项视频目标分割基准中的 3 项领先、EgoSchema 困难子集提升 12 分、内部 EgoChores 测试手部定位比 Gemini 3.8 Flash 好 50%。以上均为厂商自报,The Neuron 已明确标注。
- 定价:$0.15 / $1.50 每百万输入 / 输出 token。
- 音频被提为一等模态:官方示例为用多普勒效应预测卡车最接近观察者的精确时间戳。
- 托管平台实测(近三日):端到端延迟 P50 2.79 秒、P95 14.77 秒、P99 30.95 秒;工具调用错误率 5.55%;结构化输出错误率 1.83%;可用性 99.97%;缓存命中率 0.0%。
perceptron/perceptron-mk1.5 的公开实测数据(页面标注统计区间为 2026-09-23 09:00 至 2026-09-26 09:00)、以及 AGI HUNT 2026-09-26 期的收录条目。素材时间窗为前一日 18:00 → 当日 09:00:Mk1.5 于美东 09-25 发布,北京时间 09-25 夜间至 09-26 早晨落地,属隔夜窗口内的新发布。需要明示的边界:① 全部基准成绩均为厂商自报,The Neuron 原文已注明 "Those benchmark comparisons are company-reported",无第三方独立复现;② 内部 EgoChores 测试为公司自建评测集,与公开基准不可比,且对比对象 Gemini 3.8 Flash 的版本与调用配置未披露;③ 上下文长度存在两个口径(The Neuron 32K / OpenRouter 37K),本文并列呈现,不择一;④ "2–5 倍提速"未说明测试硬件、输入模态与任务类型,是相对 Mk1 的比值,不是绝对延迟;⑤ OpenRouter 的延迟与错误率为单一托管平台、近三日、单供应商的观测值,样本请求量与调用方构成未披露,且该平台上的调用以通用应用为主(页面列出的头部应用为代码编辑器与 Web UI,非机器人控制),不能等同于本体上的实时控制表现;⑥ 缓存命中率 0.0% 意味着上述延迟未受益于任何缓存,是保守值;⑦ 端到端 P50 2.79 秒为平台统计口径,与官方所说"端到端比 Mk1 快 2–5 倍"不是同一个测量对象。与存量稿件的差异:本站产品发布类写过宇树 Dex5-S 灵巧手(硬件参数与工位边界)、Feather 模块化人形(本体单位经济),本篇落点是模型层"一套权重跨本体"这一主张,与它在托管平台上被独立记录到的延迟分布之间的落差。判断性内容均以"判断:"开头。Mk1.5 的卖点非常清晰:**一个模型,三种本体,不做平台级重训**。这句话如果成立,它改变的是具身智能的成本结构——现在每一类本体都要养一套自己的模型与数据闭环,如果一套权重能同时开无人机、四足和眼镜,那么新增一个本体形态的边际成本会大幅下降。
但卖点归卖点,能核实的证据是分开的。左边是厂商自报的能力,右边是托管平台独立记录的运行数据,两组数字讲的不是同一件事。
4 项视频目标分割基准中 3 项领先;EgoSchema 困难集 +12 分;EgoChores 手部定位优于 Gemini 3.8 Flash 50%;端到端比 Mk1 快 2–5 倍。
端到端 P50 2.79 秒 / P95 14.77 秒 / P99 30.95 秒;工具调用错误率 5.55%;结构化输出错误率 1.83%;可用性 99.97%。
OpenRouter 模型页给出的端到端延迟分布,是这条发布里最有价值的一组数字:
中位数 2.79 秒,P99 30.95 秒——**尾部是中位数的约 11 倍**。这是典型的重负载、多工具调用场景的延迟分布:绝大部分请求在 3 秒内返回,但每 100 次里约有 1 次要等超过 30 秒。
再看错误率:**工具调用错误率 5.55%**,也就是大约每 18 次工具调用会有 1 次失败;**结构化输出错误率 1.83%**。Mk1.5 的一个核心设计就是把推理与世界知识拆开——遇到需要世界知识的问题,调用外部搜索与反向图像搜索,而不是把知识塞进权重。这个设计很省参数,代价是**把可靠性押在了工具调用上**。
官方对 Mk1.5 的能力描述可以拆成五条,其中三条是真正跨本体的,两条是通用能力:
| 能力 | 描述 | 是否依赖本体 |
|---|---|---|
| 飞行与四足控制 | 零样本控制无人机与四足,无需平台级重训 | 是,但宣称零样本 |
| 对象跟踪 | 把物体作为带时间戳的几何来跟踪 | 否,通用视觉能力 |
| 音频推理 | 用多普勒效应预测卡车最接近的时刻 | 否,但需本体有麦克风 |
| 外部工具调用 | 搜索、反向图像搜索 | 否 |
| 并行子智能体 | 分解复杂任务,如识别篮中食材以检查过敏原 | 否 |
The Neuron 记为 **32K 上下文**,OpenRouter 模型页记为 **37K**。差 5K,约 15%。
这类分歧通常有两个来源:一是发布时宣传的"标称上下文"与实际上线时供应商配置的"有效上下文"不同(常见做法是留一部分给系统提示与输出);二是不同接入层统计口径不同。报道没有解释,两者也没有互相引用。
Mk1.5 定价 **$0.15 / $1.50** 每百万输入 / 输出 token。缓存命中率是 **0.0%**,意味着目前所有请求都在付全价。
这个价格对"推理 + 工具调用 + 子智能体"这种重调用模式是有意义的:一次复杂查询可能触发多轮工具调用与多个子智能体,每轮都要重新把上下文送进去。**在缓存命中率为 0 的情况下,成本与调用轮数近似线性相关**——这也从成本侧解释了为什么那 5.55% 的工具调用错误率值得关注:失败的那次调用,钱已经花了。