当前位置:首页 > AGI 与 AI 意识研究 > 正文内容

全景可供性预测

论文信息
英文标题:Panoramic Affordance Prediction
作者:Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen et al.(2026)
来源:arXiv:2603.15558v1 | PDF全文

中文摘要

可供性预测是具身AI中感知与行动的关键桥梁。但现有研究局限于针孔相机(视场窄/观察碎片化)。本文首次探索全景可供性预测,用360度图像捕捉全局空间关系与整体场景理解。引入PAP-12K基准(1000+超高清全景图/1.2万QA对/可供性掩码)。提出PAP:受人类中央凹视觉启发的无训练由粗到细管线,递归视觉路由定位目标、自适应注视矫正局部畸变、级联接地提取实例掩码。实验显示现有方法在全景下严重退化,PAP显著超越SOTA。

核心贡献与解读

把可供性预测从针孔相机拓展到360全景,提供基准+无训练方法,机器人全景感知有实用价值。

关键词

全景可供性 / 360视觉 / 视觉语言导航

相关文章

AGI不是更大的模型:从专用AI到通用智能的鸿沟

AGI不是更大的模型:从专用AI到通用智能的鸿沟

很多人觉得GPT-5、Claude就是AGI的前夜,再堆点算力就能"涌现"出通用智能。但事实是——我们连"通用智能"到底长什么样都没想清楚。这篇文章聊聊专用AI和AGI之间那道看不见、却真实存在的鸿沟...

机器能"感受"疼痛吗:AI意识的科学边界

机器能"感受"疼痛吗:AI意识的科学边界

如果有一天,一台机器人被"踩了一脚"后大喊"好疼",我们该相信它真的疼,还是觉得它在演戏?这个问题看似哲学清谈,却直接关系到我们未来如何对待越来越聪明的机器。今天聊聊AI意识的科学边界。 意识是什么:...

大模型真的理解语言吗:理解之谜与中文房间

大模型真的理解语言吗:理解之谜与中文房间

GPT能写出让你落泪的情书,能 debug 你写了三天的代码,能和你聊存在主义到深夜。但一个幽灵始终徘徊在这个领域:它真的"理解"自己在说什么吗?还是只是高级的"文字接龙"?今天拆解这个让图灵奖得主都...

意识的数学:整合信息理论(IIT)与Φ值

意识的数学:整合信息理论(IIT)与Φ值

能不能像测量温度一样,给一个系统的"意识程度"打个分?神经科学家朱利奥·托诺尼真的试了——他提出了一套叫"整合信息理论"(IIT)的框架,用一个叫Φ(Phi)的值来量化意识。这个理论对AI可不友好。...

图灵测试过时了吗:现代AI能力评测新范式

图灵测试过时了吗:现代AI能力评测新范式

1950年,图灵提出一个判据:如果机器在文字对话中骗过了人类,就认为它有智能。七十五年过去,GPT轻松通过这个测试,但没人觉得它已经"通用智能"了。图灵测试,是不是该退休了? 图灵测试的聪明与局限 图...

AI觉醒的边界:从《她》到现实的距离

AI觉醒的边界:从《她》到现实的距离

电影《她》里,男主爱上了操作系统萨曼莎;现实中,Google工程师曾公开声称对话模型LaMDA"有了灵魂"。AI觉醒到底是科幻的预演,还是人类的自我投射?今天我们扒开这层浪漫的滤镜。 科幻给了我们错误...