当前位置:

首页 > 利用全景图视觉自注意力模型进行室内框架估计的方法

利用全景图视觉自注意力模型进行室内框架估计的方法

一、研究背景此方法主要关注室内框架估计(indoorestimationlayoutestimation)任务,任务输入2D图片,输出图片所描述场景的三维模型。考虑到直接输出三维模型的复杂性,该任务一般被拆解为输出2D图像中的墙线、天花板线、地线三种线的信息,再根据线的信息通过后处理操作重建房间的三维模型。该三维模型可在后期进一步用于室内场景复刻、VR看房等具体应用场景。区别于深度估计方法,该方法基于对室内墙线的估计来恢复空间几何结构,优势在于可使墙面的几何结构较为平整;劣势则在于无法恢复室内场景沙发、椅

利用全景图视觉自注意力模型进行室内框架估计的方法

一、研究背景

此方法主要关注室内框架估计(indoor estimation layout estimation)任务,任务输入2D图片,输出图片所描述场景的三维模型。考虑到直接输出三维模型的复杂性,该任务一般被拆解为输出2D图像中的墙线、天花板线、地线三种线的信息,再根据线的信息通过后处理操作重建房间的三维模型。该三维模型可在后期进一步用于室内场景复刻、VR看房等具体应用场景。区别于深度估计方法,该方法基于对室内墙线的估计来恢复空间几何结构,优势在于可使墙面的几何结构较为平整;劣势则在于无法恢复室内场景沙发、椅子等细节物品的几何信息。

根据输入图像的不同,可以将其分为基于透视图和基于全景图的方法。与透视图相比,全景图具有更大的视角和更丰富的图像信息。随着全景采集设备的普及,全景数据越来越丰富,因此目前有很多关于基于全景图进行室内框架估计的算法被广泛研究

利用全景图视觉自注意力模型进行室内框架估计的方法

相关算法主要包括LayoutNet、HorizonNet、HohoNet及Led2-Net等,这些方法大多基于卷积神经网络,在结构复杂的位置墙线预测效果较差,如有噪声干扰、自遮挡等位置会出现墙线不连续、墙线位置错误等预测结果。在墙线位置估计任务中,仅关注局部特征信息会导致该类错误的发生,需利用全景图中的全局信息考虑整条墙线的位置分布来估计。CNN方法在提取局部特征任务中表现更优,Transformer方法更擅长捕捉全局信息,因此可将Transformer方法应用于室内框架估计任务以提升任务表现。

利用全景图视觉自注意力模型进行室内框架估计的方法

由于训练数据依赖性,单独应用基于透视图预训练的Transformer估计全景图室内框架效果并不理想。PanoViT模型预先将全景图映射到的特征空间,使用Transformer学习全景图在特征空间的全局信息,同时考虑全景图的表观结构信息完成室内框架估计任务。

利用全景图视觉自注意力模型进行室内框架估计的方法

二、方法介绍与结果展示

1、PanoViT

网络结构框架包含4个模块,分别是Backbone,vision transformer解码器,框架预测模块,边界增强模块。Backbone模块将全景图映射至特征空间,vison transformer编码器在特征空间中学习全局关联,框架预测模块将特征转化为墙线、天花板线、地线信息,后处理可进一步得到房间的三维模型,边界增强模块突出全景图中边界信息对于室内框架估计的作用。

利用全景图视觉自注意力模型进行室内框架估计的方法

① Backbone模块

由于直接使用transformer提取全景图特征效果不佳,已经证明了基于CNN的方法的有效性,即CNN特征可用于预测房屋框架。因此,我们采用了CNN的backbone来提取全景图不同尺度的特征图,并在特征图中学习全景图像的全局信息。实验结果表明,在特征空间中使用transformer的效果明显优于直接在全景图上应用

利用全景图视觉自注意力模型进行室内框架估计的方法

② Vision transformer encoder模块

Transformer主体架构可主要分为三个模块,包括patch sampling、patch embedding和transformer的multi-head attention。输入同时考虑全景图像特征图与原始图像并针对不同输入采用不同patch sampling方法。原图使用均匀采样方法,特征图采用水平采样方法。来自HorizonNet的结论认为在墙线估计任务中水平方向特征具有更高重要性,参考此结论,embedding过程中对于特征图特征进行竖直方向压缩。采用Recurrent PE方法组合不同尺度的特征并在multi-head attention的transformer模型中进行学习,得到与原图水平方向等长的特征向量,通过不同的decoder head可获得对应的墙线分布。

利用全景图视觉自注意力模型进行室内框架估计的方法

随机循环位置编码(Recurrent Position Embedding)考虑到全景图沿水平方向位移不改变图像视觉信息的特征,因此每次训练时沿着水平轴方向随机选取初始位置,使得训练过程更关注不同patch之间的相对位置而非绝对位置。

利用全景图视觉自注意力模型进行室内框架估计的方法

③ 全景图的几何信息

全景图中几何信息的充分利用可有助于室内框架估计任务表现的提升。PanoViT模型中的边界增强模块强调如何使用全景图中的边界信息,3D Loss则帮助减少全景图畸变影响。

边界增强模块考虑到墙线检测任务中墙线的线状特征,图像中的线条信息重要性突出,因此需要突出边界信息使得网络了解图像中线的分布。使用频域中边界增强方法突出全景图边界信息,基于快速傅里叶变换得到图像频域表示,使用掩膜在频域空间中进行采样,基于傅里叶反变换变换回边界信息被突出的图像。模块核心在于掩膜设计,考虑到边界对应高频信息,掩膜首先选用高通滤波器;并根据不同线的不同走向方向采样不同的频域方向。该方法相对传统LSD方法实施简单且效率更高。利用全景图视觉自注意力模型进行室内框架估计的方法

之前工作在全景图上计算像素距离作为估计误差,由于全景图畸变,图片上的像素距离并不正比于3D世界的真实距离。PanoViT使用3D损失函数,直接在3D空间中计算估计误差。

利用全景图视觉自注意力模型进行室内框架估计的方法

2、模型结果

使用Martroport3D、PanoContext公共数据集进行实验,采用2DIoU和3DIoU作为评价指标,并与SOTA方法进行对比。结果显示PanoViT在两个数据集上的模型评价指标基本达到最优,仅在特定指标上略逊于LED2。通过与Hohonet进行模型可视化结果的比较,可以发现PanoViT能够准确识别复杂场景中的墙线走向。通过消融实验中对比Recurrent PE、边界增强和3D Loss模块,可以验证这些模块的有效性

利用全景图视觉自注意力模型进行室内框架估计的方法

利用全景图视觉自注意力模型进行室内框架估计的方法

利用全景图视觉自注意力模型进行室内框架估计的方法

为了达到更好的模型数据集,收集十万多张室内全景图像自建全景图像数据集,包含各类复杂室内场景,并基于自定规则进行标注,从中选取5053张图像作为测试数据集。在自建数据集上测试PanoViT模型与SOTA模型方法表现,发现随着数据量增大,PanoViT模型性能提升显著。

利用全景图视觉自注意力模型进行室内框架估计的方法

三、如何在ModelScope中使用

  • 打开modelscope官网:https://modelscope.cn/home。
  • 搜索“全景图室内框架估计”。
  • 点击快速使用-在线环境使用-快速体验,打开notebook。
  • 输入主页示例代码,上传1024*512的全景图片,修改图片加载路径,运行输出墙线预测结果。

利用全景图视觉自注意力模型进行室内框架估计的方法

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
上一篇: win7原版iso下载
相关文章 更多
“异算方舟”国产计算系统软件生态全栈平台发布
“异算方舟”国产计算系统软件生态全栈平台发布

6月29日,中科院计算机网络信息中心等单位发布“异算方舟”国产计算系统软件生态全栈平台。该平台针对算法供给不足、代码迁移困难、智能应用落地慢三大痛点,打造九衍枢算法库、无界BoundX代码转换大模型、Agent-HiReFlow自动化仿真智能体三大能力,提供从底层算法到代码适配再到智能应用的一体化解决方案。

熵基科技发布HuggingZKT算法商城
熵基科技发布HuggingZKT算法商城

熵基科技发布HuggingZKT算法商城,面向空间智能领域打造端云协同AI算法管理平台,覆盖算法训练、发布、订阅、升级等全生命周期,形成开放高效的算法服务体系,推动园区、楼宇等场景的AI能力敏捷调用,助力空间智能规模化应用迈入新阶段。

芬兰阿尔托大学找到了让视觉文档理解彻底摆脱
芬兰阿尔托大学找到了让视觉文档理解彻底摆脱"坐标困境"的新路径

芬兰阿尔托大学提出用语言引用原文代替坐标定位,解决视觉文档理解中的归因幻觉问题。实验显示,该方法使归因幻觉率从97%降至28%,证据召回率从个位数提升至50%以上,且答案质量几乎不变。

对于懂得编程的人来说,编程对你来说有什么乐趣?编程大概是什么感觉?
对于懂得编程的人来说,编程对你来说有什么乐趣?编程大概是什么感觉?

解决编程问题后的痛快、完成作品的成就感、获取知识的满足感,以及用代码实现简化生活的惊喜与踏实,这些是编程独有的乐趣,只有真正写代码的人才能体会其中的酸甜苦辣、惊喜与满足,令人回味无穷。

以前我没学过编程 请问编程从那里学起
以前我没学过编程 请问编程从那里学起

编程语言仅为工具,真正决定高度的是数据结构和算法及计算机底层逻辑理解。建议从C语言入门,打好基本功。根据目标选择深入方向,避免同时学习多门语言。最终目标是学会用程序解决问题,语言只是实践载体。

编程和我
编程和我

考取了程序员证书,却无法与“程序员”身份画等号,更偏爱算法和底层操作,对软件工程兴趣寥寥。编程作为兴趣能带来挑战与喜悦,一旦沦为重复工作便失去意义。坚持自然学习,远胜于强制赶进度。

趣味编程:少儿编程思维的启蒙之旅
趣味编程:少儿编程思维的启蒙之旅

Scratch图形化编程以拖拽积木块方式启蒙少儿编程思维,无需记忆代码语法。通过素材库、即时反馈和社区协作,帮助孩子在创作中理解顺序执行、条件判断等核心概念,锻炼逻辑、创造力和问题解决能力。

函数式编程与异步编程学习
函数式编程与异步编程学习

函数式编程和异步编程,是很多开发者绕不开的两个核心概念。它们听起来有点学术,但实际上在日常的软件开发中,尤其是现代后端、数据处理和并发场景里,几乎无处不在。今天我们就来捋一捋,这两者到底在讲什么,以及怎么用Python写点实际的例子。 函数式编程 函数式编程,简单说就是一种把计算过程当成数学函数组合

再论中文编程
再论中文编程

中文编程旨在用母语写代码,但易语言等早期方案因理论根基不实、生态薄弱而失败。核心突破依赖编译原理创新,如解决产生式数量导致的LR状态爆炸问题,可尝试解释型分析法和公共命名空间。

count\_if与all\_of高效使用技巧解析
count\_if与all\_of高效使用技巧解析

count_if用于统计满足条件的元素个数,all_of用于判断所有元素是否都满足条件,二者均通过谓词进行判断,可结合Lambda表达式简化使用,在处理复杂数据时需设计合适的谓词,并注意其线性时间复杂度带来的性能影响。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。