CoT3DRef:基于链式锚点推理的数据高效三维视觉定位
三维视觉定位(3D Visual Grounding)旨在根据自然语言描述,在三维场景中定位描述所指向的具体物体。与一般的物体分类任务不同,该任务不仅要求模型判断目标属于哪一个类别,还要求模型在多个同类别实例中确定正确的空间实体。 例如,给定描述“找出距离放有白色和红色盒子的书架最近的椅子”,目标类别虽然是椅子,但模…
Notes, thoughts, and what I am learning.
这里收录了所有的 3 篇文章 (第 1 / 1 页)
Article Calendar
三维视觉定位(3D Visual Grounding)旨在根据自然语言描述,在三维场景中定位描述所指向的具体物体。与一般的物体分类任务不同,该任务不仅要求模型判断目标属于哪一个类别,还要求模型在多个同类别实例中确定正确的空间实体。 例如,给定描述“找出距离放有白色和红色盒子的书架最近的椅子”,目标类别虽然是椅子,但模…
强化学习(Reinforcement Learning, RL)研究的是一类典型的 序贯决策(Sequential Decision Making) 问题。 与监督学习中“给定输入 $x$,预测标签 $y$”的学习范式不同,强化学习所关心的并不是一次孤立的预测,而是: 一个智能体应该如何在不断变化的环境中连续做出决策…
EEGAgent:基于大语言模型的自动化 EEG 分析统一框架 现有的 EEG(Electroencephalography,脑电图)自动分析方法已经覆盖异常脑电识别、癫痫事件检测、睡眠分期、抑郁识别等多个任务。然而,这些方法大多围绕某一个预先定义的目标独立设计:一个模型负责一个任务,一个数据集对应一种标签体系,一个…