当机器人大脑开始"思考":蚂蚁灵波融资背后的人机协作体验革命
阅读:2
更新时间:2026-08-03 20:37:08
陆家嘴的玻璃幕墙映着八月的天光,写字楼里的送餐机器人沿固定轨道缓缓移动,避障、停步、转向,每一个动作都精确却僵硬。你对它说"帮我拿瓶水",它听不懂。你挡在它面前,它只会停下,然后重复播放"请让一让"。这是今天大多数服务机器人的真实体验——它们有身体,却没有真正的大脑。
这种割裂感,正是我作为一名工业设计师在过去几年里反复面对的困境。我们可以把机器人的外形做得足够亲和,把关节的运动曲线调得足够顺滑,把交互界面打磨得足够精致,但只要机器人无法真正理解人的意图、无法自主应对物理世界的不确定性,所有表层的设计就都只是装饰。
所以当蚂蚁灵波确认启动首轮融资、拟募资15亿元的消息传来,我关注的不是估值数字本身,而是这件事对人机交互体验意味着什么。灵波是蚂蚁集团的全资子公司,也是蚂蚁在具身智能领域最核心的布局载体。它聚焦的方向很明确——具身智能的"通用大脑"。这个定位,恰好戳中了当前机器人产业体验困局的要害。
目前灵波已经推出LingBot系列模型,累计发布10余款,其中LingBot-VLA是具身智能基座模型,LingBot-VA是具身动作模型,LingBot-Vision是空间原生视觉基座模型,LingBot-World是世界模型。这四个名字听起来技术化,但翻译成体验语言,它们分别对应着机器人"理解指令与环境的能力""生成动作的能力""看见并理解空间的能力"以及"在脑中预演物理过程的能力"。视觉感知、空间理解、任务决策、动作生成——这四个环节构成了一条完整的具身智能模型体系,也恰好覆盖了一个机器人从"接收到指令"到"完成任务"之间必须跨越的全部体验鸿沟。
在传统的机器人交互模式中,这条鸿沟是由人来填补的。工程师逐动作编程,用户按预设流程操作,机器人只能在高度结构化的环境中执行高度确定的任务。交互设计的本质,是让人去适应机器的局限——菜单层级要深,因为机器人能理解的指令很少;操作区域要规整,因为机器人认不出杂乱的场景;容错空间要小,因为一个意外就可能导致任务中断。
通用大脑要做的事情,是把这条鸿沟反过来填平。不是人去理解机器,而是机器去理解人。
这让人想起唐纳德诺曼在《设计心理学》中反复强调的一个观点:好的设计让人不需要思考就能正确操作,其核心在于示能性——物本身通过形态、语义和反馈,向人暗示它可以做什么、怎么用。门把手的形状暗示"拉",推板的平面暗示"推",这些不需要文字说明。而在人机交互领域,当机器人拥有了通用大脑,示能性的主体开始发生微妙的反转:不再仅仅是物向人示能,机器人也开始主动"读懂"人的示能。你手指一个方向,它理解你指向什么;你说"把那边那个东西拿过来",它知道"那边"是哪边、"那个东西"是哪个。语言、手势、眼神,这些人与人之间最自然的沟通方式,第一次有了成为人机交互主界面的可能。
这不是简单的语音助手升级。语音助手处理的是信息,而具身大脑处理的是物理行动。当你对智能音箱说"帮我开灯",它发一个信号就够了;当你对机器人说"帮我把桌上的杯子拿过来",它需要识别杯子的位置和姿态,规划手臂的运动轨迹,控制握力不至于捏碎,避开路上的障碍物,走到你面前确认交付——这中间涉及感知、推理、决策、执行的完整闭环。LingBot-VLA作为基座模型,解决的就是这个闭环的"理解"端:把视觉输入和语言指令映射为动作指令。而LingBot-VA负责把动作指令细化为关节级别的运动控制。LingBot-Vision提供空间层面的环境认知,LingBot-World则让机器人在行动之前先在"脑"中模拟物理后果。
这套体系在技术指标上的表现也值得关注。一个有意思的数据是,在国内GitHub Star排名中,蚂蚁灵波全系列接近3万,是第二名的2.7倍多。开发者社区的选择往往比任何宣传都更诚实——Star数意味着有人愿意看你的代码、用你的模型、在你的基础上做二次开发。这背后反映的是模型的通用性和易用性已经形成了事实上的生态吸引力。
更直接的指标是适配广度。LingBot-VLA 2.0已经适配了17个机器人品牌、20多种机器人构型,包括宇树、智元、银河通用、乐聚等。这个数字的体验含义在于:同一个"大脑"可以装进不同的"身体"里。一台四足机器人和一台人形机器人,硬件形态天差地别,但底层的感知和决策逻辑可以共享。这就像不同品牌的手机可以运行同一个操作系统,开发者不需要为每一台机器人重写底层智能,机器人本体厂商也不需要从零开始造大脑。
产业正在进入"拼大脑"的阶段。这个判断我认同。过去几年机器人行业的竞争焦点在硬件——谁的关节更灵活、谁的续航更久、谁的结构更紧凑。但硬件的差距正在快速收敛,当不同品牌的机器人在运动能力上越来越接近,真正拉开体验差距的,就是谁更"聪明"。一台能听懂模糊指令、能自主应对意外、能在陌生环境中完成任务的机器人,和一台只能按剧本走的机器人,用户体验的差距不是线性的,而是代际的。
在这个判断下,蚂蚁灵波给出的未来核心竞争力有三个:模型能力、真实世界数据、规模化落地效率。从设计角度看,这三者恰好对应体验优化的三个层级。
模型能力是体验的上限。模型越强大,机器人能理解的语境越丰富,能执行的任务越复杂,交互的容错空间越大。今天你还需要把指令拆成"走到桌子旁边,伸出手,抓住杯子,转过来,走回来",未来可能只需要说"帮我拿杯水"。这种从"命令式交互"到"意图式交互"的转变,是人机关系的根本性重塑。工业设计师不再需要为每一个操作设计繁复的菜单和按钮,因为自然语言本身就是最丰富的交互界面。但这同时也带来了新的设计挑战:当机器人能理解任何指令,它如何向用户表达自己"能做什么、不能做什么"?当交互不再依赖结构化的界面,反馈和确认应该以什么形式存在?这些都是产品语义学在具身智能时代需要回答的新问题。
真实世界数据是体验的根基。实验室里的演示永远光鲜,但零售店里有散乱的货架、拥挤的人流、突然闯入的小孩;物流仓库里有堆叠变形的纸箱、地面上的水渍、灯光的明暗变化。这些长尾场景是任何仿真环境都无法完全覆盖的,只有让机器人在真实场景中持续运行、持续收集数据、持续迭代模型,体验才能真正可靠。灵波已经在零售、物流等场景推进商业化测试,这一步至关重要。在我们江苏创品工业设计的实践中,一直强调"4力5维"方法论——从洞察力、整合力、实现力、进化力四种能力出发,围绕用户、场景、技术、商业、文化五个维度系统思考产品。真实世界数据正是"洞察力"和"场景维度"的交汇点:你不到现场,就不知道用户真正需要什么;你不跑数据,就不知道模型在哪里翻车。
规模化落地效率是体验到达用户的速度。一个模型再好,如果适配一台新机器人需要三个月,落地一个新场景需要半年,那它的体验优势就会被时间稀释。LingBot-VLA 2.0能够快速适配17个品牌20多种构型,说明灵波在跨平台迁移上已经形成了工程化能力,这本身就是一种"实现力"的体现。而蚂蚁集团在AI Infra和应用场景上持续给予最大支持,则为这种效率提供了基础设施保障。
说到蚂蚁集团的支持力度,有一个信息值得注意:灵波累计投入资金已超过一线创业公司的融资额。本轮融资之后,灵波仍然是蚂蚁在具身和物理AI领域最核心的载体。这意味着灵波不是蚂蚁内部的一个探索性项目,而是战略级布局。融资的目的也很明确——加快具身大脑的发展。
从行业格局看,蚂蚁集团坚定布局具身智能并不意外。蚂蚁的业务天然扎根于真实的物理消费场景——零售支付、物流配送、本地生活,这些场景本身就是机器人最大的应用市场。当通用大脑足够成熟,蚂蚁的场景资源可以为灵波提供其他纯技术公司难以企及的数据闭环和落地通道。而灵波的大脑能力,反过来又能为蚂蚁生态中的海量终端设备注入智能。这是一种"大脑加场景"的双向驱动。
回到上海。这座城市有一种独特的气质:张江的实验室里跑出最前沿的模型,陆家嘴的写字楼里运行着最密集的服务场景,南京路上的人流每天都在产生无法预测的真实世界数据。国际化的商业环境和完整的制造供应链在这里交汇,让上海成为具身智能从实验室走向商业化最理想的试验场之一。我在设计实践中越来越强烈地感受到,一座城市的消费场景密度,直接决定了机器人智能迭代的速度。因为只有在足够复杂、足够多元、足够真实的环境中,机器人才会遇到那些"设计师想不到但用户一定会做"的事情。
而这些"想不到"的瞬间,恰恰是体验设计最需要关注的。
比如一个酒店配送机器人进入电梯,里面站满了人,它是该进去还是等下一趟?这个决策没有标准答案,需要对社交距离、文化习惯、任务紧急程度做综合判断。比如一个零售理货机器人发现货架上的商品被顾客挪了位置,它是按原始位置记录还是更新认知?比如一个物流搬运机器人遇到地面上一滩不知道是什么的液体,它该绕行还是跨越还是停下来求助?这些问题不是单一的技术问题,而是技术、设计、伦理和商业的交叉地带。通用大脑的价值,在于它有能力处理这些模糊地带,而不是只能在"是"与"否"之间做选择。
诺曼后来在《情感化设计》中把体验分为三个层次:本能层、行为层和反思层。本能层是外观和第一印象,行为层是使用过程中的效用和效率,反思层是用户在使用之后形成的认知和情感联结。目前市面上的大多数机器人产品,设计精力主要集中在本能层——把外形做萌、把灯光做炫、把语音做俏皮。行为层受限于智能水平,始终难以突破。而通用大脑的成熟,第一次让行为层体验有了质的跃迁可能:机器人不是在"表演"智能,而是在"交付"结果。当行为层的根基夯实之后,反思层的设计——用户对机器人的信任感、依赖感甚至情感联结——才有了生长的土壤。
这并不意味着工业设计师的角色会被削弱,恰恰相反,当底层智能不再是瓶颈,设计的价值会向上游迁移。以前我们花大量时间设计"怎么让用户学会操作机器人",未来我们需要花更多时间思考"机器人应该以什么方式存在于人的空间中"。它移动时应该离人多远?它完成任务后应该安静离开还是说一句话?它出错时应该如何承认错误并恢复?当机器人能听懂任何话,我们还要不要给它一个屏幕?当机器人能自主决策,我们还要不要保留一个"紧急停止"按钮,以及它应该在哪里、长什么样?这些问题没有技术答案,只有设计答案。
示能性的概念在这里同样适用。机器人的外形、尺寸、运动方式、灯光和声音,都在持续向周围的人发出信号:我是谁,我在做什么,你可以怎么对我。一个底盘低矮、移动缓慢的机器人给人安全感,一个高大魁梧、动作迅猛的机器人让人本能避让。工业设计师需要有意识地运用这些产品语义,让机器人的物理形态与它的智能水平相匹配,而不是制造"看起来很聪明但实际上很笨"的期望落差。灵波覆盖了20多种机器人构型,不同构型的示能性截然不同——四足机器犬和轮式底盘的社交暗示完全不同,人形机器人和机械臂的用户期待也天差地别。通用大脑提供了统一的智能内核,但每一种身体的体验设计都需要独立思考。
从更大的时间尺度看,具身智能正在经历一场从"工具"到"协作伙伴"的身份转变。工具是被动的,你操作它,它响应;协作伙伴是主动的,它理解意图、预判需求、协调行动。这个转变不会一蹴而就,但方向已经清晰。灵波推进具身智能从基础模型研发向真实场景应用落地,本质上就是在推动这种身份转变从论文和Demo走向普通人的日常生活。
15亿首轮融资、年底二轮融资目标、10余款模型、17个品牌适配、近3万GitHub Star、零售物流商业化测试——把这些事实拼在一起,呈现的是一条从技术研发到生态构建再到场景落地的完整路径。蚂蚁集团把灵波定位为具身和物理AI领域最核心载体,并承诺在AI Infra和应用场景上持续投入,这为路径的延续性提供了背书。
而对我这样的设计师来说,真正令人兴奋的是:我们终于可以不再围着机器人的"能力边界"做妥协式设计了。当大脑足够通用,当感知足够准确,当决策足够可靠,设计的起点可以从"机器人能做什么"变成"人需要什么"。这个顺序的颠倒,就是体验范式重塑的真正含义。
上海的夜色落下来的时候,张江的灯还亮着。那些正在训练中的模型,那些正在零售店里试跑的机器人,那些正在被采集和标注的真实世界数据,正在一点点缩短"能用"和"好用"之间的距离。这个距离,既是技术的距离,也是设计的距离。而横跨这段距离的桥梁,叫做通用大脑。