
股票杠杆是什么意思
这项由清华大学深圳国际研究生院与零智机器人Z-Lab联合主导、多伦多大学参与合作的研究,以预印本形式发布于2026年8月1日,编号为arXiv:2608.00730,有兴趣深入阅读原文的读者可通过该编号在arXiv平台检索完整论文。
**一场厨房里的头疼事,变成了机器人领域的难题**
每个人大概都有过这样的经历:桌上倒了一摊番茄酱,或者花生酱蹭在了桌面上。你拿出一块抹布去擦,结果非但没擦干净,反而把污渍越抹越大,最后整张桌子上留下一道道棕红色的痕迹。这种"越擦越脏"的窘境,对于人类来说只是一次轻微的挫败感,但对于机器人而言,却是长期以来悬而未决的技术挑战。
清华大学的研究团队正是从这个朴素的生活场景出发,开发出了一套名为Push-Wiper的机器人清洁系统,专门用来对付那些粘稠、难缠、越擦越扩散的"粘性污渍"。这套系统在测试中取得了比传统方法高出130%的清洁效果,并且能在没有额外训练的情况下,把同样的策略迁移到各种弯曲表面、固体残渣、液体污渍乃至从未见过的粘稠物质上。
**一、粘稠污渍为何让机器人"手足无措"**
要理解这个研究的价值,先得搞清楚粘稠污渍究竟难在哪里。
普通液体污渍,比如水或者果汁,可以被抹布轻松吸收。固体残渣,比如饼干碎屑,可以用刷子扫走。但花生酱、番茄酱这类物质处于一种中间状态——它们既不像水那样可以被吸干,也不像固体那样能够被整块移走。这类物质在流体力学里被称为具有"复杂流变特性",通俗来说就是:你推它,它会变形;你刮它,它会附着在工具上;你擦它,它会被工具带着到处乱跑。
番茄酱在常温下的粘度大约在1000到1500毫帕·秒之间(这个单位可以理解为液体"厚度"的度量,水的粘度大约是1毫帕·秒),而花生酱的粘度则高达29452毫帕·秒,几乎是番茄酱的20倍。这意味着花生酱对桌面的附着力极强,稍有不慎就会被工具带着大面积扩散。
现有的机器人清洁方案主要走两条路。第一条是"覆盖式擦拭",就是让机器人按照预设路线来回擦拭整个桌面,这对液体很有效,但对粘稠污渍来说就是灾难——海绵会把污渍越拖越开。第二条是"擦洗",用毛刷类工具高频往复运动产生足够的摩擦力来刮除污渍,虽然有一定效果,但用力过猛容易损伤桌面,而且需要极精确的力度控制。还有一个现实困难是,现实桌面上的污渍形态多种多样——有时是一滩,有时是散落的几块,有时形状奇特,机器人很难用单一策略应对所有情况。
更复杂的是,在桌面场景里不能像洗碗那样用大量水来冲洗稀释,水资源受限让清洁难度进一步上升。
**二、换个思路:别擦,先"聚"**
清华大学的研究团队提出了一个颇有意思的视角转换:与其直接清除污渍,不如先把它们"聚拢"。
这个思路在生活中其实很常见。打扫房间时,我们通常不是随机地在地板上扫来扫去,而是先用扫帚把所有灰尘推到一个角落,聚成一堆,再统一收走。Push-Wiper就是把这个策略搬到了处理粘稠污渍上。
研究团队把整个清洁流程分成两个阶段。第一个阶段叫做"聚拢阶段",机器人用一块海绵,通过一系列精心设计的推压动作,把散落在桌面各处的污渍逐步推拢到一个小区域,就像把沙堆推成一个小山包。第二个阶段叫做"后处理阶段",污渍已经被聚拢到一个小范围内,机器人再用一系列特定动作把这团聚拢好的残渣彻底清除,并同时完成海绵的自清洁。
这个"先聚后清"的策略从根本上绕开了粘稠流体的扩散问题——既然每次接触都可能导致污渍扩散,那就把扩散方向控制在一个可以接受的范围内,让污渍只能"往里缩"而不是"往外扩"。
为了让这个策略真正可行,研究团队需要解决三个核心问题:机器人如何"看懂"污渍的分布、如何决定下一步往哪个方向推、以及如何把二维的推压计划转化为在三维弯曲桌面上的实际动作。
**三、用"黑白地图"教会机器人看污渍**
机器人的"眼睛"是安装在手腕上的一个深度摄像头。每次机器人移动到一个固定的观察位置时,摄像头就会拍一张照片。
然而,直接把彩色照片喂给机器人并不是最好的选择。番茄酱是红褐色的,花生酱是黄棕色的,未来可能遇到的黑胡椒酱是深色的,生蚝酱又是另一种颜色。如果机器人是靠颜色来认识污渍,那么每遇到一种新的污渍就需要重新训练,适应性就大打折扣。
研究团队的解决方案相当简洁:把彩色图像转换成纯粹的黑白二值图,污渍区域显示为黑色,干净区域显示为白色。这就好比把一张彩色地图变成了一张简单的"脏/净分布图",完全剥离了颜色信息,只保留了形状和位置信息。
这个处理方式有一个关键优势:机器人学到的是"如何把黑色区域推拢到一起",而不是"如何处理红色液体"。黑白地图是通用的,番茄酱变成了黑色区域,花生酱也变成了黑色区域,第一次见到的牡蛎汁同样变成了黑色区域。机器人不需要认识具体是什么物质,只需要认识"这里有污渍,那里没有"。这正是Push-Wiper能够在不重新训练的情况下处理各种新污渍的根本原因。
系统在检测污渍时,综合了HSV色彩空间、Lab色彩空间和灰度图像的多种线索,再经过形态学处理和连通区域过滤,生成最终的二值污渍地图。清洁评分的计算方式也因此变得直观——用清洁前和清洁后图像中的污渍像素数量来计算,减少了多少比例就是多少分。
**四、机器人的"决策大脑":扩散模型来帮忙**
拿到黑白污渍地图之后,机器人需要决定下一步动作:应该从哪个方向推、推多远、推完之后怎么转个角度再推一次。这个决策问题比看起来要复杂得多。
同一团污渍,可以从左边推向右边,也可以从右边推向左边,还可以从四个角同时往中心推,理论上有无数种有效的推法。这种"一个问题有多个正确答案"的情况,在机器学习里叫做"多模态分布",是很多传统算法不擅长处理的。
研究团队选择了一种叫做"扩散策略"的算法来处理这个问题。扩散策略(Diffusion Policy)是近年来机器人领域崛起的一种方法,它的灵感来自于人工智能图像生成领域的扩散模型——那种能够从随机噪声中逐渐"生成"出清晰图像的技术。
可以这样理解扩散策略的工作原理:给机器人看一张污渍地图,机器人在脑子里先生成一堆随机的"候选动作方案",然后不断地把这些方案往"合理"的方向修正,就像雕塑家从一块石头里慢慢雕刻出形状一样。每修正一步,方案就变得更像一个合理的推压动作,最终收敛到一个具体的执行方案。
这个算法特别擅长处理多模态分布——它可以学会"从左推是对的,从右推也是对的",并在实际执行时根据当时的情况选择其中一种,而不是把两种方向平均起来(那样会导致机器人往奇怪的对角线方向推,两头都没效果)。
不过,研究团队在使用扩散策略时做了一个重要的设计决定:不让它实时连续工作,而是让它阶段性地工作。每次机器人回到观察位置,拍一张照片,扩散策略根据这张照片生成一整段推压轨迹,机器人按照这段轨迹推完,然后再回来观察,再生成下一段轨迹……如此循环。
这个设计的背后有很实际的考虑。机器人在接触桌面推压污渍的时候,手腕摄像头对着桌面,根本看不到污渍分布;而如果在桌面侧面架一个固定摄像头,又经常被机械臂本身遮挡住视线。与其强行维持一个不可靠的实时视觉反馈,不如老老实实地"拍一张、推一段、再拍、再推"。
机器人的动作空间也被刻意限制得很简单:每个推压动作只有三个参数,分别是目标位置的横坐标、纵坐标,以及海绵的旋转角度。不用指定推多深、用多大力、手腕如何弯曲,这些都交给后续的其他模块处理。用三个数字描述一次推压动作,大大降低了学习难度。
**五、从"平面指令"到"曲面执行"的神奇桥梁**
决策大脑产生了一系列二维平面上的推压动作,但真实的桌面可能是平的,也可能是弯曲的。如何把"在平面上往左推10厘米"翻译成"在一个弯曲表面上让机械臂做对应的运动",是一个需要专门处理的问题。
研究团队为此开发了一个叫做"任意曲面姿态插值器"(ASPI)的模块。这个模块的职责就是在二维决策和三维执行之间搭建一座桥。
它的工作流程可以这样理解:假设决策大脑说"把海绵移动到坐标(30, 50)的位置,旋转15度",ASPI首先把这个二维坐标"投影"到真实桌面上,找到对应的三维空间位置,同时测量出那个位置的桌面法线方向(也就是垂直于桌面的方向)。然后,ASPI确保海绵在那个位置时,始终以垂直桌面的方式接触桌面——就像一个人无论是在平桌上还是在斜坡上擦东西,都会自然地让抹布贴合桌面而不是歪着。
更进一步,ASPI还需要把一系列离散的位置点连接成一条平滑的运动轨迹,因为机器人如果从一个点突然跳到另一个点,会产生剧烈的加速度变化,让力度控制变得不稳定。ASPI用B样条曲线拟合这些关键点,再用梯形速度规划确保运动平滑,用球面线性插值处理姿态变化,最终生成一条在100赫兹(每秒100次)频率下可以稳定执行的完整轨迹。
这个模块的关键价值在于:让决策模块完全不需要知道桌面是什么形状。决策大脑只负责在一个标准的二维平面上规划推压策略,ASPI负责把这个策略适配到任何形状的真实表面上。训练时只用平面桌面的数据,部署时遇到弯曲桌面也能正确执行,原因就在这里。
**六、让海绵真正"贴紧"桌面的力度控制**
把运动轨迹生成好之后,还有最后一个关键问题:机器人推压时需要对桌面施加足够的压力,才能真正推动粘稠污渍,但压力又不能太大,否则会损坏桌面。
Push-Wiper采用了一种叫做"混合力-位置控制"的方案,这是工业机器人中成熟的力控技术。简单来说,这套控制方案把机器人的运动分成两个方向来分别管理:沿桌面方向的运动(左右前后)严格按照轨迹来走,而垂直桌面方向的力度则通过实时反馈来调节。
具体调节机制叫做"导纳控制",可以用一个弹簧-阻尼系统来类比。如果机器人对桌面施加的力比目标值(实验中设定为20牛顿)小,就让海绵继续往下压一点;如果超过了目标值,就稍微抬起来一点。连接在手腕上的六轴力传感器会持续反馈实际接触力,控制器以100赫兹的频率不断调整。
这套力控系统的好处是:即使桌面有轻微的高低不平,或者遇到弯曲表面,力控层会自动补偿,始终维持稳定的接触压力,而上层的轨迹规划完全不需要关心这些细节。
**七、训练数据怎么来的**
整个系统需要"学习"才能工作,学习的原材料是人类操控机器人演示的清洁动作。
研究团队用一个叫做SpaceMouse的手持控制设备远程操控机器人,在平面桌面上演示了150个清洁任务。其中一半用番茄酱,一半用花生酱;每种酱料里,三分之一是简单情况(单块污渍、占图像面积不超过20%),三分之二是复杂情况(多块分散污渍或大面积污渍)。
演示过程中,操控者的策略和人打扫卫生的直觉类似:看到污渍从哪个方向可以推拢,就往那个方向推一段,然后换个角度再推一段。每个任务包含多段这样的分步推压,最终积累了448段推压轨迹。
有了这些数据,研究团队还进行了数据增强——通过对黑白地图和对应轨迹做一致的几何变换(旋转、翻转等),把448段轨迹扩充到了2688段,大大丰富了训练数据的多样性。
**八、清洁完成后:五个动作彻底收尾**
聚拢阶段结束后,污渍已经被推到了一个很小的区域里。但这团聚拢的残渣还需要被彻底清除,同时海绵在反复推压过程中也沾满了污渍,需要进行自清洁。
后处理阶段通过五个预设的动作原语来完成这些任务。第一步是"点压",机器人用海绵轻轻往下点压,把聚拢区域内的残渣从桌面上"提"起来,吸附到海绵上。第二步是"刮除",用旁边配备的刮板把海绵上吸附的污渍刮掉,收集到废料区。第三步是"冲洗",把海绵在清水槽中涮一涮,去掉残余污物。第四步是"挤压",挤出海绵中多余的水分,调节湿度,避免海绵过于潮湿而影响后续清洁效果。第五步是"全覆盖擦拭",用处理好的清洁海绵对整个清洁区域做最后一遍全面擦拭,清除残余痕迹。
这五个动作不需要机器学习,都是预先编好的固定程序。它们的执行同样使用混合力-位置控制,确保力度恰当。这个设计体现了"简单的事情用简单的方法做"的原则——聚拢污渍是复杂的,需要学习;清除聚拢好的残渣是相对固定的,预设程序就够了。
**九、实验数据说话:130%的提升从何而来**
研究团队设计了一个系统的对比实验来验证Push-Wiper的效果。实验中一共测试了三种方法,分别代表三种不同的策略哲学。
第一种叫做"全覆盖擦拭",简称FC,就是让机器人按照弓形或往返路线把整个桌面扫一遍,是最传统的机器人清洁策略。第二种叫做"一次性全推",简称PO,同样采用"观察-规划-执行"的分步模式,但每次都规划一条贯穿整个污渍区域的长轨迹,试图一次性推完。第三种就是Push-Wiper,采用分段短程推压、逐步聚拢的策略。
每种方法在番茄酱和花生酱上各做20次实验,简单和复杂污渍分布各占一半。清洁评分(CS)的计算是清除污渍像素的百分比,100分代表完全清洁干净。
结果相当清晰。全覆盖擦拭方法的平均得分只有32.64分。这个数字甚至比看起来还要糟糕,因为在某些花生酱实验中,擦拭之后污渍面积反而比之前更大,出现了负分情况——越擦越脏是真实发生的。一次性全推方法的成绩稍好,平均44.98分,但同样存在无法消除残余碎片的问题,特别是在花生酱上,得分只有31.99,效果相当有限。而Push-Wiper的整体平均得分达到89.88分,在所有情况下都保持稳定。
把Push-Wiper的89.88分与FC的32.64分相比,提升幅度约为175%;与PO的44.98分相比,提升幅度约为100%;综合来说,研究团队报告的"最高130%的提升"是在特定对比条件下的描述。实验中还记录了每次测试的时间,Push-Wiper平均每轮清洁耗时约130秒,在这段时间内基准方法也被允许尽可能多地执行操作,确保比较的公平性。
**十、弯曲表面也难不倒它**
把在平面桌面上学到的策略应用到弯曲表面,是Push-Wiper最具说服力的能力之一。
实验团队准备了一个凸面(向上隆起)和一个凹面(向下凹陷)的表面,这两种形状在日前的训练数据中完全没有出现过。在每种表面上,分别用番茄酱和花生酱进行了各5次复杂污渍的测试。结果是:凸面上平均清洁得分91.45分,凹面上平均清洁得分93.42分,与平面桌面上的表现相当。
为什么能做到这一点?关键就在于ASPI模块的设计。决策模块输出的是平面坐标,ASPI接管之后,会实时获取表面的三维形状信息,把平面坐标映射到真实的弯曲表面上,并调整海绵的姿态让它始终垂直于当地表面。无论桌面是什么形状,海绵接触的方式都是一致的,决策模块感知到的始终是同样格式的黑白地图,不受表面形状影响。
**十一、固体、液体,通吃**
除了粘稠污渍和弯曲表面,研究团队还测试了几种全新的场景,用来检验系统的零样本泛化能力。
固体碎片用五块随机散落的黑色圆盘来模拟。对于固体,海绵无法"清除"它们,但可以把它们推拢到一起。实验标准是:如果最终所有圆盘都变成一个连通区域,就算成功,得100分;否则得0分。Push-Wiper在10次实验中全部成功,得分100。
液体污渍用可乐来测试,可乐是低粘度液体,和高粘度番茄酱、花生酱的行为完全不同。Push-Wiper的平均得分是92.62分,显示出良好的适应性。
全新粘稠污渍用黑胡椒酱和蚝油来测试,这两种物质在训练时从未出现过。平均得分94.42分,进一步验证了黑白二值化处理带来的颜色无关性。
这一系列测试共同表明:Push-Wiper学到的是"如何推拢一团黑色区域"的通用策略,而不是针对某种特定物质的专用技能。
**十二、后处理加持:趋近完美的清洁**
在之前所有实验中,Push-Wiper的结果都是只用聚拢阶段、不加后处理阶段得到的。最后一组实验专门验证加入后处理阶段之后的效果。
番茄酱实验5次,从聚拢阶段平均93.76分提升到了100分,彻底清洁。花生酱实验5次,从85.12分提升到98.51分,提升幅度达到15.73%。两种污渍综合平均从89.44分提升到99.25分。
从93分到100分这个提升或许看起来幅度不大,但从实际效果上说,这是从"桌面还有一小团残渣"到"桌面完全干净"的差距,对于真正的清洁任务来说,这个差距非常显著。
归根结底,Push-Wiper做的事情,就是把一道看似需要"正面硬刚"的难题,换了一个思维框架——与其直接对付顽固污渍,不如先把它们"团结"在一起再一举清除。这种迂回战术搭配上精心设计的技术模块,让一块普通海绵和一个学习了几百次演示的算法,在面对厨房里最难搞的污渍时,达到了接近完美的清洁效果。
机器人家政服务领域还有很长的路要走,Push-Wiper的研究团队也坦承,未来的工作需要在有人类在场的环境中增加碰撞安全约束,以及把后处理阶段扩展到更多种类的污渍形态。但这套"聚拢-清除"的基本范式,以及背后那个"用二维黑白地图屏蔽三维复杂性"的设计哲学,为机器人清洁领域提供了一条值得深入探索的新路径。有兴趣跟进这个方向的读者,可以通过arXiv:2608.00730查找完整论文,项目演示视频也可以通过论文中附带的项目主页地址找到。
---
Q&A
Q1:Push-Wiper为什么不直接擦拭粘稠污渍,而要先"推拢"?
A:直接擦拭粘稠污渍(如花生酱)时,海绵接触污渍会把它带着到处扩散,越擦越脏。Push-Wiper选择先用推压动作把污渍聚拢到一个小区域,让污渍只能"向内收缩"而不是向外扩散,再统一清除。实验数据证明,这种方式比传统全覆盖擦拭的清洁评分高出约130%。
Q2:Push-Wiper处理弯曲桌面时需要重新训练吗?
A:不需要。系统中有一个叫做"任意曲面姿态插值器"(ASPI)的模块,会把决策大脑输出的二维推压坐标自动适配到真实的三维弯曲表面上,并调整海绵姿态使其始终垂直于当地表面。决策模块本身完全不感知表面形状,因此训练数据全部来自平面桌面,遇到凸面或凹面时也能直接使用,无需额外训练。
Q3:Push-Wiper对不同类型的污渍都有效吗?
A:是的。系统把图像转换成纯黑白的污渍分布图股票杠杆是什么意思,完全去除了颜色信息,学到的是"如何推拢黑色区域"的通用策略。在测试中,除了训练用的番茄酱和花生酱外,系统还成功处理了从未见过的蚝油、黑胡椒酱(粘稠液体)、可乐(低粘度液体)和固体圆盘,无需任何额外训练。
文章为作者独立观点,不代表杠杆炒股的首选_联华证券炒股_股票怎么用杠杆观点