arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Northeastern University(东北大学)

2026-08-25 至 2026-08-25 共收录 6
2608.22885 2026-08-25 cs.CV 新提交

DRAgent: Discriminative Reasoning Agent for Referring Expression Segmentation

DRAgent:用于指代表达分割的判别推理智能体

Yujie Qi, Luyan Zhang

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Khoury College of Computer Sciences, Northeastern University(东北大学Khoury计算机科学学院)

AI总结 本文针对指代表达分割中MLLM单次坐标预测导致的定位偏差问题,提出DRAgent判别推理框架,通过两阶段目标选择与LoRA微调提升性能,在多个基准数据集上表现具竞争力。

Comments 5 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22731 2026-08-25 cs.AI cs.HC cs.RO 新提交

LLM-Based Selection of Incongruent Verbal and Nonverbal Behavior for Virtual Humans

基于大语言模型的虚拟人类言语与非言语不一致行为选择

Parisa Ghanad Torshizi, Stacy Marsella

机构 * Khoury College of Computer Science(计算机科学学院(科里学院)) Northeastern University(东北大学)

AI总结 该研究针对虚拟人类言语与非言语行为的不一致问题,提出分类法,探究LLM对情境适配的不匹配行为的选择能力,并通过人类受试者研究验证其效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22690 2026-08-25 cs.CV 新提交

MorphoCLIP: Text-Supervised Contrastive Learning for Perturbation Matching in Cell Painting Images

MorphoCLIP:用于细胞绘画图像扰动匹配的文本监督对比学习

Sukhrobbek Ilyosbekov (1), Shubham Gajjar (1), Rongfei Jin (1) ((1) Northeastern University)

机构 * Northeastern University(东北大学)

AI总结 MorphoCLIP是一种仅训练跨通道模块和投影层的对比模型,可实现细胞绘画图像与扰动描述的双向匹配,文本监督有助于组织相关数据,但化合物与遗传扰动的匹配仍待解决。

Comments 9 pages, 4 figures, 6 tables. Code: this https URL (https://github.com/suxrobGM/morphoclip)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22676 2026-08-25 cs.AI 新提交

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

智能体人工智能对不一致和不完整工具响应的鲁棒性分析

Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

机构 * Aalborg University(奥尔堡大学) Zhejiang University(浙江大学) Northeastern University(东北大学)

AI总结 该研究通过在零售客户服务领域注入受控故障,分析智能体AI对不一致、不完整工具响应的鲁棒性,发现两类响应在特定通道中可不对称识别,动作分布特征存在差异。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22236 2026-08-25 cs.SD cs.LG eess.AS 新提交

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

MRMAD:用于评估大型音频语言模型中声学降级感知的多轮多音频基准

Yize Li, Ningyuan Yang, Sile Yin, Sindhuja Thogarrati, Sung-En Chang, Andrew C. Singer, Xue Lin, Chuan-Che Huang, Shuo Zhang

机构 * Northeastern University(东北大学) Bose Corporation(博士公司) Stony Brook University(石溪大学)

AI总结 该研究提出MRMAD多轮多音频基准,评估18种LALMs的音频降级感知,发现现有模型难可靠推理降级,为构建鲁棒LALMs提供基础。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21778 2026-08-25 cs.RO 新提交

Vision Guided Target Conditioned Control for Autonomous Excavation

面向自主挖掘的视觉引导目标条件控制

Shuai Zhao, Ji-An Pan, Junwei Li, Xun Tang, Fansen Xi, Qing Xu, Keqiang Li, Jianqiang Wang

机构 * Liaoning University(辽宁大学) Northeastern University(东北大学) Tsinghua University(清华大学)

AI总结 该研究针对自主挖掘问题,提出结合视觉目标条件与配对演示的掩码条件动作块Transformer框架,在模拟任务中显著提升挖掘成功率与堆料清理效率,为挖掘机自动化提供实用方案。

Comments 5 pages, 3 figures, 3 tables. Accepted at ISCSIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏