纯数字 AI 的时代正在演变,初创公司正致力于弥合软件智能与物理执行之间的鸿沟。Perceptron 是由前 Meta AI 研究员创立的新兴企业,正通过开发前沿视觉模型来引领这一潮流,旨在帮助机器在现实世界中进行导航和交互。

打破二元论:通用模型 vs. 专用模型

多年来,工业自动化一直陷入技术僵局。开发者通常必须在两种方案之间做出选择:要么是庞大的通用基础模型,每个实例都需要昂贵的专用云端 GPU;要么是狭窄的专用模型,虽然可以处理感知或控制,但缺乏同时具备这两者的能力。

Perceptron 的联合创始人 Armen Aghajanyan 和 Akshat Shrivastava 均来自 Meta 的基础人工智能研究(FAIR)部门,他们正试图通过其新模型 Isaac 0.5 来解决这一问题。与旨在处理单一、重复任务的现有软件不同,Isaac 0.5 是一个通用模型。它赋予了机器人“感知、推理和行动”的能力,使其能够适应各种环境,而不是被硬编码为执行某一种特定的动作。

物理智能的机制

要理解 Perceptron 方法的复杂性,必须观察一个标准的仓库任务,例如分拣包裹。机器人不能简单地“拿起一个盒子”;它必须首先读取标签,进行空间分析以绘制周围环境的地图,决定最佳抓取顺序,并规划其物理轨迹。

Isaac 0.5 旨在管理这些多步骤的认知过程。该模型经过大规模训练,吸收了一百万小时的通用视频数据,以识别各种环境和场景。为了掌握物理灵活性,该公司利用了“第一视角视频”(ego video,来自可穿戴摄像头的视角)和 UMI 视频(重复人类动作的记录)来教 AI 如何将动作转化为任务完成。Shrivastava 指出,公司已经构建了包含图像、文本、视频和机器人轨迹的拍字节(petabyte)级数据集,以实现这种“算法炼金术”水平。

开源权重策略与市场扩张

为了鼓励透明度和开发者的采用,Perceptron 正将 Isaac 0.5 作为开源权重(open-weight)模型发布。这允许研究人员和工程师检查其参数和训练材料,这是将 AI 集成到对可预测性要求极高的关键工业环境中的重要一步。

在由 Bessemer Venture Partners 领投的 2100 万美元融资支持下,Perceptron 正将自己定位为广泛领域的智能层。虽然主要重点是物流和制造业,但该公司也看到了在安保、移动出行,甚至媒体和娱乐领域的即时应用。通过提供灵活的智能层,Perceptron 旨在改变视觉引导机器人在全球工业领域的运作方式。

核心要点

  • 弥合鸿沟: Isaac 0.5 旨在通过提供通用的“感知、推理和行动”框架,消除在资源密集型通用模型与功能有限的专用模型之间的选择。
  • 大规模训练规模: 该模型利用了一百万小时的视频数据(包括第一视角和 UMI 视频),以教机器人完成复杂的空间和手动任务。
  • 开源权重的可访问性: 通过发布开源权重的 Isaac 0.5,Perceptron 使研究人员能够更深入地检查并更快地将前沿视觉 AI 集成到工业工作流中。

Perceptron 推出了 Isaac 0.5,这是一款开源权重的视觉模型,有望为机器人提供统一的“感知-推理-行动”大脑。这家初创公司筹集了 2100 万美元,由 Bessemer Venture Partners 领投,并将该模型定位为物流、制造业和其他物理自动化市场的即插即用(drop-in)智能层。

为什么这次发布至关重要

工业机器人长期以来被迫在两者之间进行权衡。部署庞大的通用基础模型,你必须支付持续的云端 GPU 访问费用;而坚持使用狭窄的特定任务视觉系统,则会在环境变化时失去灵活性。Isaac 0.5 被定位为中间地带——一个无需每个实例都使用云端计算,即可处理感知、规划和控制的模型。

当今机器人大脑的问题

一个典型的仓库机器人不仅仅是抓取一个箱子。它必须读取标签、在杂乱的环境中定位物品、决定最佳抓取顺序,并计算出一条无碰撞的机械臂轨迹——所有这些都必须实时完成。现有的解决方案通常将这些步骤拆分到不同的软件组件中:用于识别标签的轻量级检测器、用于运动的手工规划器,以及用于执行的基于规则的控制器。这种拆分增加了集成开销,并限制了机器人在面对新产品、包装风格或布局变化时的适应能力。

Isaac 0.5 如何尝试弥合这一差距

Perceptron 的联合创始人 Armen Aghajanyan 和 Akshat Shrivastava 均为前 Meta FAIR 研究员,他们将 Isaac 0.5 构建为一个单一的端到端网络。该模型基于大约一百万小时的通用视频数据进行训练,涵盖了各种室内外场景。至关重要的是,训练集还包括“ego video”(通过穿戴式摄像头拍摄的第一人称视频)和“UMI video”(人类重复动作的记录)。通过将视觉流与机器人轨迹数据配对并输入网络,Perceptron 声称该模型能够学习如何将视觉线索转化为物理运动。

公司表示,其数据集涵盖了拍字节(petabytes)级别的图像、文本、视频和机器人轨迹。这种广度旨在赋予 Isaac 0.5 识别新物体、推断其可利用性(affordances,即如何抓取)并生成运动规划的能力,且无需独立的控制模块。

开源权重模型:透明度与实用性的结合

与大多数仅提供 API 的商业 AI 产品不同,Perceptron 发布 Isaac 0.5 时采用了开源权重的方式。工程师可以检查参数、利用私有数据对网络进行微调,或者直接将模型嵌入到边缘硬件中。