当前位置:

首页 > 业界资讯 > 同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

本文解读我们获得CVPR2022最佳学生论文奖的工作《EPro-PnP:GeneralizedEnd-to-EndProbabilisticPerspective-n-PointsforMonocularObjectPoseEstimation》。论文研究的问题是基于单张图像估计物体在3D空间中的位姿。现有方法中,基于PnP几何优化的位姿估计方法往往通过深度网络提取2D-3D关联点,然而因为位姿最优解在反向传播时存在不可导的问题,难以实现以位姿误差作为损失对网络进行稳定

本文解读我们获得 CVPR 2022 最佳学生论文奖的工作《EPro-PnP: Generalized End-to-End Probabilistic Perspective-n-Points for Monocular Object Pose Estimation》。论文研究的问题是基于单张图像估计物体在 3D 空间中的位姿。现有方法中,基于 PnP 几何优化的位姿估计方法往往通过深度网络提取 2D-3D 关联点,然而因为位姿最优解在反向传播时存在不可导的问题,难以实现以位姿误差作为损失对网络进行稳定的端到端训练,此时 2D-3D 关联点依赖其他代理损失的监督,这对于位姿估计而言不是最佳的训练目标。

为解决这一问题,我们从理论出发,提出了 EPro-PnP 模块,其输出位姿的概率密度分布而非单一的位姿最优解,从而将不可导的最优位姿替换为了可导的概率密度,实现了稳定的端到端训练。EPro-PnP 通用性强,适用于各类具体任务和数据,可以用于改进现有的基于 PnP 的位姿估计方法,也可以借助其灵活性训练全新的网络。从更一般的意义来说,EPro-PnP 本质是将常见的分类 softmax 带入到了连续域,理论上可以推广至训练一般的嵌套了优化层的模型。

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

论文链接:https://arxiv.org/abs/2203.13254

代码链接:https://github.com/tjiiv-cprg/EPro-PnP

一、前言

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

我们研究的是 3D 视觉中的一个经典问题:基于单张 RGB 图像定位其中的 3D 物体。具体而言,给定一张含有 3D 物体投影的图像,我们的目标是确定物体坐标系到相机坐标系的刚体变换。这一刚体变换被称为物体的位姿,记作 y,其包含两部分:1)位置(position)分量,可用 3x1 的位移向量 t 表示,2)朝向(orientation)分量,可用 3x3 的旋转矩阵 R 表示。 

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

针对这一问题,现有方法可以分为显式和隐式两大类。显式方法也可称作直接位姿预测,即使用前馈神经网络(FFN)直接输出物体位姿的各个分量,通常是:1)预测物体的深度,2)找出物体中心点在图像上的 2D 投影位置,3)预测物体的朝向(朝向的具体处理方法可能比较复杂)。利用标有物体真实位姿的图像数据,可以设计损失函数直接监督位姿预测结果,轻松地实现网络的端到端训练。然而,这样的网络缺乏可解释性,在规模较小的数据集上易于过拟合。在 3D 目标检测任务中,显式方法占据主流,尤其是对于规模较大的数据集(例如 nuScenes)。

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

隐式方法则是基于几何优化的位姿估计方法,最典型的代表是基于 PnP 的位姿估计方法。这类方法中,首先需要在图像坐标系中找出 N 个 2D 点(第 i 点 2D 坐标记作同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读),同时在物体坐标系中找出与之相关联的 N 个 3D 点(第 i 点 3D 坐标记作同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读),有时还需要获取各对点的关联权重(第 i 对点的关联权重记作同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读)。根据透视投影约束,这 N 对 2D-3D 加权关联点隐式地定义了物体的最优位姿。具体而言,我们可以找出使重投影误差最小的物体位姿同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

其中同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读,表示加权重投影误差,是位姿的同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读函数。同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读表示含有内参的相机投影函数,同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读表示元素乘积。PnP 方法常见于物体几何形状已知的 6 自由度位姿估计任务中

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

基于 PnP 的方法也需要前馈网络去预测 2D-3D 关联点集同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读。相比于直接位姿预测,这一深度学习结合传统几何视觉算法的模型有非常好的可解释性,其泛化性能较为稳定,但在以往的工作中模型的训练方法存在缺陷。很多方法通过构建代理损失函数,去监督 X 这一中间结果,这对于位姿而言不是最优的目标。例如,已知物体形状的前提下,可以预先选取出物体的 3D 关键点,然后训练网络去找出对应的 2D 投影点位置。这也意味着代理损失只能学习 X 中的部分变量,因此不够灵活。如果我们不知道训练集中物体的形状,需要从零开始学习 X 中的全部内容该怎么办?

显示和隐式方法的优势互补,如果能够通过监督 PnP 输出的位姿结果,端到端地训练网络去学习关联点集 X ,则可以将二者优势结合。为实现这一目标,一些近期研究利用隐函数求导实现了 PnP 层的反向传播。然而,PnP 中的 argmin 函数在某些点是不连续不可导的,使得反向传播并不稳定,直接训练难以收敛。

二、EPro-PnP 方法介绍

1、EPro-PnP 模块

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

为了实现稳定的端到端训练,我们提出了端到端概率 PnP(end-to-end probabilistic PnP),即 EPro-PnP。其基本思想是将隐式位姿视作一个概率分布,则其概率密度同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读对于 X 是可导的。首先基于重投影误差定义位姿的似然函数:

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

若使用无信息先验,则位姿的后验概率密度为似然函数的归一化结果:

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

可以注意到,以上公式与常用的分类 softmax 公式同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读分接近,其实 EPro-PnP 的本质就是将softmax从离散阈搬到了连续阈,把求和同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读换成了积分同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

2、KL 散度损失

在训练模型的过程中,已知物体真实位姿同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读,则可以定义目标位姿分布同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读。此时可以计算 KL 散度同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读作为训练网络所用的损失函数(因同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读固定,也可以理解为交叉熵损失函数)。在目标同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读趋近于 Dirac 函数的情况下,基于 KL 散度的损失函数可以简化为以下形式:

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

如对其求导则有:

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

可见,该损失函数由两项构成,第一项(记作同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读)试图降低位姿真值同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读的重投影误差,第二项(记作同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读)试图增大预测位姿同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读各处的重投影误差。二者方向相反,效果如下图(左)所示。作为类比,右边就是我们在训练分类网络时常用的分类交叉熵损失。

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

3、蒙特卡洛位姿损失

需要注意到,KL 损失中的第二项同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读中含有积分,这一积分没有解析解,因此必须通过数值方法进行近似。综合考虑通用性,精确度和计算效率,我们采用蒙特卡洛方法,通过采样来模拟位姿分布。

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

具体而言,我们采用了一种重要性采样算法——Adaptive Multiple Importance Sampling(AMIS),计算出K个带有权重同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读的位姿样本同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读,我们将这一过程称作蒙特卡洛 PnP:

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

据此,第二项同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读可以近似为关于权重同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读的函数,且同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读可以反向传播:

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

位姿采样的可视化效果如下图所示:

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

4、针对 PnP 求解器的导数正则化

尽管蒙特卡洛 PnP 损失可以用于训练网络得到高质量的位姿分布,但在推理阶段,还是需要通过 PnP 优化求解器来得到最优位姿解同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读。常用的高斯 - 牛顿及其衍生算法通过迭代优化求解同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读,其迭代增量是由代价函数同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读的一阶和二阶导数决定的。为使 PnP 的解同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读更接近真值同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读,可以对代价函数的导数进行正则化。设计正则化损失函数如下:

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

其中,同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读为高斯 - 牛顿迭代增量,与代价函数的一阶和二阶导数有关,且可以反向传播,同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读表示距离度量,对于位置使用 smooth L1,对于朝向使用 cosine similarity。在同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读不一致时,该损失函数促使迭代增量同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读指向实际真值。

三、基于 EPro-PnP 的位姿估计网络

我们在 6 自由度位姿估计和 3D 目标检测两个子任务上分别使用了不同的网络。其中,对于 6 自由度位姿估计,在 ICCV 2019 的 CDPN 网络的基础上稍加修改并用 EPro-PnP 训练,用来进行 ablation studies;对于 3D 目标检测,在 ICCVW 2021 的 FCOS3D 基础上设计了全新的变形关联(deformable correspondence)检测头,以证明 EPro-PnP 可以训练网络在没有物体形状知识的情况下直接学出所有 2D-3D 点和关联权重,从而展现 EPro-PnP 在应用方面的灵活性。

1、用于 6 自由度位姿估计的稠密关联网络

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

网络结构如上图所示,只是在原版 CDPN 的基础上修改了输出层。原版 CDPN 使用已经检测到的物体 2D 框裁剪出区域图像,输入到 ResNet34 backbone 中。原版 CDPN 将位置与朝向解耦为两个分支,位置分支使用直接预测的显式方法,而朝向分支使用稠密关联和 PnP 的隐式方法。为了研究 EPro-PnP,改动后的网络只保留了稠密关联分支,其输出为 3 通道的 3D 坐标图,以及 2 通道关联权重,其中关联权重经过了 spatial softmax 和 global weight scaling。增加 spatial softmax 目的是对权重同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读进行归一化,使其具有类似 attention map 的性质,可以关注相对重要的区域,实验证明权重归一化也是稳定收敛的关键。Global weight scaling 反映了位姿分布同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读的集中程度。该网络仅需 EPro-PnP 的蒙特卡洛位姿损失就可以训练,此外可以增加导数正则化,以及在物体形状已知的情况下增加额外的 3D 坐标回归损失。

2、用于 3D 目标检测的变形关联网络

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

网络结构如上图所示。总体而言是基于 FCOS3D 检测器,参考 deformable DETR 设计的网络结构。在 FCOS3D 的基础上,保留其 centerness 和 classification 层,而将其原有的位姿预测层替换为 object embedding 和 reference point 层,用于生成 object query。参考 deformable DETR,我们通过预测相对于 reference point 的偏移量得到 2D 采样位置(也就得到了同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读)。采样后的 feature 经由 attention 操作聚合为 object feature,用于预测物体级别的结果(3D score,weight scale,3D box size 等)。此外,采样后各点的 feature 在加入 object embedding 并经由 self attention 处理后输出各点所对应的的 3D 坐标同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读和关联权重同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读。所预测的同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读全部可由 EPro-PnP 的蒙特卡洛位姿损失训练得到,不需要额外正则化就可以收敛并有较高的精度。在此基础上,可以增加导数正则化损失和辅助损失进一步提升精度。

四、实验结果

1、6 自由度位姿估计任务

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

使用 LineMOD 数据集实验,并严格与 CDPN baseline 进行比对,主要结果如上。可见,增加 EPro-PnP 损失进行端到端训练,精度显著提升(+12.70)。继续增加导数正则化损失,精度进一步提升。在此基础上,使用原版 CDPN 的训练结果初始化并增加 epoch(保持总 epoch 数与原版 CDPN 的完整三阶段训练一致)可以使精度进一步提升,其中预训练 CDPN 的优势部分来源于 CDPN 训练时有额外的 mask 监督。

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

上图是 EPro-PnP 与各种领先方法的比较。由较落后的 CDPN 改进而来的 EPro-PnP 在精度上接近 SOTA,并且 EPro-PnP 的架构简洁,完全基于 PnP 进行位姿估计,不需要额外进行显式深度估计或位姿精修,因此在效率上也有优势。

2、3D 目标检测任务

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

使用 nuScenes 数据集实验,与其他方法对比结果如上图所示。EPro-PnP 不仅相对 FCOS3D 有了明显提升,还超越了当时的 SOTA、FCOS3D 的另一个改进版本 PGD。更重要的是,EPro-PnP 目前是唯一在 nuScenes 数据集上使用几何优化方法估计位姿的。因 nuScenes 数据集规模较大,端到端训练的直接位姿估计网络已具有较好性能,而我们的结果说明了端到端地训练基于几何优化的模型能做到在大数据集上取得更加优异的性能。

3、可视化分析

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

上图显示了用 EPro-PnP 训练的稠密关联网络的预测结果。其中,关联权重同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读对图像中的重要区域进行了高光,类似于 attention 机制。由损失函数分析可知,高光区域对应的是重投影不确定性较低以及对位姿变动较为敏感的区域。

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

3D 目标检测的结果如上图所示。其中左上视图显示了变形关联网络采样出的 2D 点位置,红色表示同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读水平 X 分量较高的带你,绿色表示同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读垂直 Y 分量较高的点。绿色点一般位于物体上下两端,其主要作用是通过物体高度来推算物体的距离,这一特性并非人为指定,完全是自由训练的结果。右图显示了俯视图上的检测结果,其中蓝色云图表示物体中心点位置的分布密度,反映了物体定位的不确定性。一般远处的物体定位不确定性大于近处的物体。

同济、阿里的CVPR 2022最佳学生论文奖研究了什么?这是一作的解读

EPro-PnP 的另一重要优势在于,能够通过预测复杂的多峰分布来表示朝向的模糊性。如上图所示,Barrier 由于物体本身旋转对称,朝向经常出现相差 180° 的两个峰值;Cone 本身没有特定的朝向,因此预测结果在各个方向均有分布;Pedestrian 虽不完全旋转对称,但因图像不清晰,不易判断正面和背面,有时也会出现两个峰值。这一概率特性使得 EPro-PnP 对于对称物体不需要在损失函数上做任何特殊处理。

五、总结

EPro-PnP 将原本不可导的最优位姿转变为可导的位姿概率密度,使得基于 PnP 几何优化的位姿估计网络可实现稳定且灵活的端到端训练。EPro-PnP 可应用于一般的 3D 物体位姿估计问题,即使在未知 3D 物体几何形状的情况下,也可以通过端到端训练学习得到物体的 2D-3D 关联点。因此,EPro-PnP 拓宽了网络设计的可能性,例如我们提出的变形关联网络,这在以往是不可能训练的。

此外,EPro-PnP 也可以直接被用于改进现有的基于 PnP 的位姿估计方法,通过端到端训练释放现有网络的潜力,提升位姿估计精度。从更一般的意义来说,EPro-PnP 本质是将常见的分类 softmax 带入到了连续域,不仅可用于其他基于几何优化的 3D 视觉问题,理论上还可以推广至训练一般的嵌套了优化层的模型。


本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 模型
相关文章 更多
谨以此献给我的祖国!写在博士论文首页的承诺,她用近40年兑现
谨以此献给我的祖国!写在博士论文首页的承诺,她用近40年兑现

75岁的陈赛娟院士获上海市科技功臣奖。她让急性早幼粒细胞白血病成为全球首个可基本治愈的急性髓系白血病。从回国时无实验室、土法PCR起步,到创立“上海方案”,用三十七年兑现博士论文首页“谨以此献给我的祖国”的承诺,挽救了十余万患者生命。

30多年前交大教授获全国唯一特等奖,拍出200万,能在上海买10多套房
30多年前交大教授获全国唯一特等奖,拍出200万,能在上海买10多套房

一九九二年,上海交大教授古宏晨的磁带涂层技术在全国大学生发明大奖赛获唯一特等奖,拍卖出两百万元,当时可在上海购买十余套房,该成果一举打破日本TDK等进口垄断,意义深远,价值极高。

特斯拉FSD新增滑板识别模型
特斯拉FSD新增滑板识别模型

近日,有汽车领域博主爆料,特斯拉的FSD(完全自动驾驶)辅助系统将迎来一次重要升级,或将实现更真实的环境场景还原。在最新曝光的软件代码中,发现了大量新增的渲染模型,涵盖多种车辆与行人类型。这些新增模型包括救护车、消防车、垃圾清运车、校车、半挂式卡车、高尔夫球车、骑电动滑板车的行人、使用轮椅的行人、玩滑板的行人、推婴儿车的行人,以及道路清扫车、三轮车、拖车、火车和有轨电车等。这一系列高精度建模意味着FSD系统将能更准确识别并响应复杂交通参与者的行为。据CNMO掌握的消息,日本方面已为特斯拉FSD系统的落地扫

阿里开源14B电影级视频模型,实测可玩
阿里开源14B电影级视频模型,实测可玩

AI视频生成正迎来属于“通义”的高光时刻!就在昨晚,阿里巴巴悄然推出了一款由音频驱动的14B视频大模型——Wan2.2-S2V。只需上传一张静态图片和一段音频,就能生成出面部表情生动、口型精准匹配、肢体动作流畅自然的电影级数字人视频,效果惊艳。实际效果展示如下:△来自@AIMIRAI46487更令人振奋的是,这款新模型一经发布便全面开源,现在所有人都可以免费在通义万相官网体验使用。据官方介绍,Wan2.2-S2V的核心优势包括:支持最长分钟级的单次视频生成,画面稳定且具有一致性;具备影院级别的音

华为盘古 Ultra MoE 模型发布
华为盘古 Ultra MoE 模型发布

5月30日,华为推出了全新的AI模型——盘古UltraMoE,该模型的参数量达到了7180亿。作为一款接近万亿参数的MoE(MixtureofExperts)模型,它在整个训练过程中完全基于华为的昇腾AI平台完成,标志着华为在超大规模模型训练方面取得了重要进展。盘古UltraMoE的成功训练离不开盘古团队研发的一系列创新技术。例如,Depth-ScaledSandwich-Norm(DSSN)稳定架构的引入,显著改善了超大规模模型训练期间出现的梯度异常及

SOTA大模型加密数据评测:Qwen3仅破10%
SOTA大模型加密数据评测:Qwen3仅破10%

大语言模型面对加密数据,即便最新的Qwen3也会感到压力!尽管当下各类推理模型在多种基准测试中表现优异,但在密码学这样对逻辑严谨性和细节准确性要求极高的专业领域,模型的推理能力还有待深入挖掘。密码学不仅要求模型具备高级数学运算能力和严密的逻辑推理链,还需要其能够精准辨识复杂加密模式中的潜在规律;成功解密要求模型拥有极强的综合推理能力。上海AILab等联合推出的CipherBank测评,使用大量真实隐私场景数据和多种密码算法,严苛挑战当前最先进的大模型。CipherBank的测评结果显示,目前的大语言模型

通义千问新技能!用“扮演”方式提升推理能力,不再依赖搜索API
通义千问新技能!用“扮演”方式提升推理能力,不再依赖搜索API

强化学习(RL)结合真实搜索引擎可以显著提升大模型的检索和推理能力。然而,这一方法面临两大挑战:搜索引擎返回的文档质量不稳定,导致训练过程中的噪音和不稳定性;RL训练需要频繁部署,产生大量API开销,限制了可扩展性。针对这些问题,阿里通义实验室推出了开源解决方案ZeroSearch,这是一个无需与真实搜索引擎交互的强化学习框架。实验表明,ZeroSearch只需使用3B参数的LLM作为检索模块,就能有效提升搜索能力,并大幅节省API成本。ZeroSearch让LLM实现自给自足

Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬
Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬

不求速胜,熬吧。

第二代Ameca亮相!对答如流,表情逼真,多语种交流
第二代Ameca亮相!对答如流,表情逼真,多语种交流

编辑:桃子【新智元导读】第二代Ameca升级亮相,搭载GPT-4技术,实现实时对话。人形机器人Ameca迎来了它的第二代版本!近期,在2024年世界移动通信大会(MWC)上,全球最先进的机器人Ameca再度亮相。Ameca在会场周围吸引了大量观众。通过GPT-4的增强,Ameca能够即时回应各种问题。「展示一段舞蹈吧」。当被问及是否有情感时,Ameca通过一系列逼真的面部表情作出回应。就在几天前,开发Ameca的英国机器人公司EngineeredArts展示了他们团队的最新成果。视频中,Ameca具备了

阿里通义千问登顶全球开源榜 中国公司霸占前三
阿里通义千问登顶全球开源榜 中国公司霸占前三

4月2日,HuggingFace大模型榜单迎来更新,阿里通义千问近期开源的端到端全模态大模型Qwen2.5-Omni力压群雄,荣登榜首!DeepSeek-V3-0324和群核的SpatialLM-Llama-1B紧随其后,杭州公司包揽榜单前三甲。Qwen2.5-Omni展现出卓越的多模态处理能力,能够流畅处理文本、图像、音频和视频等多种数据类型,并实时生成文本及语音输出。在OmniBench等权威多模态融合任务评测中,其性能表现创下新纪录。令人惊喜的是,它仅拥有70亿参数的小巧体积,这使得全模态大模

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。