平台与数据集

平台与数据集

作者标注: 共同一作 通讯作者 共同一作兼通讯
ManiSoft:面向软体连续机器人的视觉语言操作
ICML 2026
ManiSoft:面向软体连续机器人的视觉语言操作

ManiSoft 提供开源的软体连续机器人视觉语言操作平台,将语言条件策略与可变形机械臂仿真及真机评测连接起来。

  • 开源平台: 集成软体连续体操作的仿真器、基准、数据集与策略工具链
  • 专家数据集: 包含 6,300 条覆盖多种语言条件操作任务的专家演示
  • 仿真到真实: 支持将操作策略从仿真环境转移并评测于真实机器人

Ziyu Wei#, Luting Wang#, Chen Gao*, Li Wen*, Si Liu*

超越二维匹配:面向几何感知跨视角目标地理定位的统一单阶段框架
ECCV 2026
超越二维匹配:面向几何感知跨视角目标地理定位的统一单阶段框架

GAGeo

GAGeo 在统一的几何感知单阶段框架中完成跨视角目标地理定位,并配套地面、无人机和卫星视角的大规模 CMA-Loc 基准。

  • 统一框架: 在异构的地面、无人机与卫星视角之间进行单阶段定位
  • 几何感知推理: 利用显式几何线索超越单纯外观匹配,提升跨视角定位
  • CMA-Loc 基准: 包含 223,767 对跨视角数据,覆盖 77,200 个地点

Liyao Wang#, Ruipu Wu#, Haojun Xu#, Lei Shi, Linjiang Huang*, Si Liu

基于几何先验自回归模型的生成式车道拓扑推理
ECCV 2026
基于几何先验自回归模型的生成式车道拓扑推理

TopoGPT

TopoGPT 将车道拓扑推理建模为自回归图生成,并引入几何先验,以在复杂驾驶场景中生成连贯的车道结构。

  • 自回归推理: 将车道拓扑作为结构化序列生成,而非孤立检测
  • 几何先验: 利用场景几何信息提升拓扑一致性与空间精度
  • 大规模训练: 基于 330 万个车道图场景进行训练

Jiahui Fu, Zehao Huang, Han Li, Naiyan Wang, Si Liu*

SVCBench:面向时空状态维护的流式视频计数基准
ECCV 2026
SVCBench:面向时空状态维护的流式视频计数基准

SVCBench 评测多模态模型在无法一次获取完整视频历史时,能否在流式视频计数过程中持续维护时空状态。

  • 流式评测: 测试在线状态维护,而非离线读取完整视频
  • 基准规模: 406 个视频、1,000 个问题、4,576 个查询点和 10,071 条标注
  • 计数推理: 衡量模型在长时间上下文中追踪细粒度事件的能力

Pengyiang Liu, Zhongyue Shi, Hongye Hao, Qi Fu, Xueting Bi, Siwei Zhang, Xiaoyang Hu, Zitian Wang*, Linjiang Huang, Si Liu

ViSTR-Bench:多模态大模型能否根据动态场景中的连续视觉线索进行推理?
arXiv 2026
ViSTR-Bench:多模态大模型能否根据动态场景中的连续视觉线索进行推理?

ViSTR-Bench 评测动态场景中的连续视觉推理,关注多模态大语言模型能否跟踪不断演化的线索,而非仅依赖稀疏关键帧。

  • 连续线索: 评测对动态场景中演化视觉证据的推理能力
  • 多样任务: 15 个子任务覆盖空间、时间与状态转移推理
  • 开源基准: 1,340 组视觉问答数据,并公开代码与数据

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

EVA-Client:真实机器人具身策略的统一数据采集、推理与部署框架
arXiv 2026
EVA-Client:真实机器人具身策略的统一数据采集、推理与部署框架

EVA-Client 将机器人数据采集、策略推理、评测与部署整合到统一开源框架中,降低在真实机器人上开展具身智能实验的工程成本。

  • 统一工作流: 连接数据采集、推理、评测与部署
  • 真机支持: 面向物理平台上可复现的具身策略实验
  • 开源框架: 模块化客户端架构,便于扩展策略与机器人形态

Heqing Yang, Yang Yi, Liyao Wang, Linqing Zhong, Donglin Yang, Ruipu Wu, Zitong Bai, Fengjiao Chen, Manyuan Zhang, Linjiang Huang, Si Liu

arXiv 2026
GE-Sim 2.0:面向机器人操作综合闭环视频世界仿真器的路线图

GE-Sim 2.0 是面向机器人操作的开源闭环视频世界仿真器,集成动作条件视频生成、可扩展评测与快速交互式 rollout。

  • 闭环仿真: 根据动作生成视觉反馈,用于交互式策略评测
  • WorldArena 评测: 为视频世界仿真器提供统一比较基准
  • 开源生态: 公开代码与模型权重,支持可复现研究与部署

Boxiang Qiu#, Liliang Chen#, Yue Liao, Nan Wang, Lintao Wang, Jiayi Luo, Wenzhi Zhao, Shengcong Chen, Di Chen, Ye Li, Chen Gao, Shuicheng Yan*, Si Liu*, Maoqing Yao*, Guanghui Ren*

OctoNav:面向通用具身导航
arXiv 2025
OctoNav:面向通用具身导航

OctoNav 是一个面向多样导航任务的通用具身导航模型,能够在不同环境中处理复杂导航需求。通过大规模预训练与多模态融合,OctoNav 在复杂室内外场景中展现出稳健表现。

  • 通用导航: 统一模型架构,可处理多类具身导航任务
  • 多模态融合: 融合视觉感知与语言指令,实现稳健控制
  • 跨环境泛化: 在多样和未见场景中展现较强泛化能力

Ziqin Wang, Xiangyu Wang, Jinyu Chen, Ruipu Wu, Linjiang Huang, Yue Liao, Si Liu

面向真实无人机视觉语言导航:平台、基准与方法
ICLR 2025
面向真实无人机视觉语言导航:平台、基准与方法

该平台面向无人机视觉语言导航,弥合仿真与真实部署之间的差距,并提供真实场景与标准化评测指标,推动自主无人机系统研究。

  • 平台: 面向无人机导航的仿真与真实测试环境
  • 基准: 包含真实场景与标准化评测指标
  • 方法: 面向视觉语言导航的 sim-to-real 方法

Xiangyu Wang, Donglin Yang, Ziqin Wang, Hohin Kwan, Jinyu Chen, Wenjun Wu, Hongsheng Li, Yue Liao, Si Liu

VideoEspresso:基于核心帧选择的大规模细粒度视频推理链式思维数据集
CVPR 2025
VideoEspresso:基于核心帧选择的大规模细粒度视频推理链式思维数据集

VideoEspresso 是面向细粒度视频推理的大规模数据集,通过链式思维标注与核心帧选择方法增强视频理解和推理能力。

  • 数据规模: 覆盖多样视频场景与推理任务的大规模数据
  • 链式思维: 面向细粒度视频理解的结构化推理过程
  • 核心帧选择: 识别并利用关键帧以提升推理效率

Songhao Han, Wei Huang, Hairong Shi, Le Zhuo, Xiu Su, Shifeng Zhang, Xu Zhou, Xiaojuan Qi, Yue Liao, Si Liu

LLaVA-ST:面向细粒度时空理解的多模态大语言模型
CVPR 2025
LLaVA-ST:面向细粒度时空理解的多模态大语言模型

LLaVA-ST 是专为细粒度时空理解设计的多模态大语言模型,能够精确理解视觉内容中的复杂空间与时间关系。

  • 多模态架构: 融合视觉与语言以进行时空推理
  • 细粒度理解: 精确理解复杂空间和时间关系
  • 应用: 提升视频理解与视觉问答等任务表现

Hongyu Li, Jinyu Chen, Ziyu Wei, Shaofei Huang, Tianrui Hui, Jialin Gao, Xiaoming Wei, Si Liu

Video2BEV:将无人机视频转换为 BEV 表示用于视频地理定位
ICCV 2025
Video2BEV:将无人机视频转换为 BEV 表示用于视频地理定位

该方法将无人机视频转换为鸟瞰视角表示,以提升视频地理定位能力,并从空中视频中实现更准确的空间理解与定位。

  • BEV 转换: 将无人机视频转换为鸟瞰视角表示
  • 地理定位: 基于空中视频进行准确空间理解与定位
  • 视频方法: 利用时序信息提升定位鲁棒性

Hao Ju, Shaofei Huang, Si Liu, Zhedong Zheng

AeroDuo:面向无人机视觉语言导航的空中双智能体系统
ACM MM 2025
AeroDuo:面向无人机视觉语言导航的空中双智能体系统

AeroDuo 面向无人机视觉语言导航,结合视觉感知与自然语言理解,实现更直观的无人机控制与导航。

  • 双系统设计: 结合视觉处理与语言理解的创新架构
  • 视觉语言融合: 实现视觉感知与自然语言理解的协同
  • 直观控制: 通过自然语言指令进行用户友好的无人机导航

Ruipu Wu, Yige Zhang, Jinyu Chen, Linjiang Huang, Shifeng Zhang, Xu Zhou, Liang Wang, Si Liu

RoboCerebra:长程机器人操作评测的大规模基准
NeurIPS 2025
RoboCerebra:长程机器人操作评测的大规模基准

RoboCerebra 是面向长程机器人操作任务的综合评测基准,提供标准化评测协议和多样场景,推动具身智能与机器人研究。

  • 大规模基准: 面向长程机器人操作的综合评测框架
  • 标准协议: 覆盖多样场景的一致评测指标与方法
  • 研究推动: 通过系统评测推动具身智能与机器人研究

Songhao Han, Boxiang Qiu, Yue Liao, Siyuan Huang, Chen Gao, Shuicheng Yan, Si Liu

ACM MM demo 2025
Hi AirStar:带我去羽毛球场

AirStar 是一个可通过自然语言命令引导用户到达指定地点的交互式演示系统,展示视觉语言导航在真实场景中的应用。

  • 交互系统: 通过自然语言交互实现实时导航
  • 实际应用: 展示视觉语言导航在真实场景中的能力
  • 用户体验: 通过对话式交互实现直观位置引导

Ziqin Wang, Jinyu Chen, Xiangyi Zheng, Qinan Liao, Linjiang Huang, Si Liu