arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Northeastern University(东北大学)

2026-09-01 至 2026-09-01 共收录 20
2608.30716 2026-09-01 cs.CL cs.CV 新提交

SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

SocialReasonBench:基于反事实叙事视频的社会推理视频问答基准

Zheyu Huang, Zijing Shi, Haozhe Luo, Huadong Tang, Mingyu Liu, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII(先进人工智能研究所)) Northeastern University(东北大学) Fudan University(复旦大学) University of Liverpool(利物浦大学)

AI总结 研究人员推出SocialReasonBench基准,评估LMMs的社会推理能力,发现其在反事实和因果推理上表现不佳,凸显了模型在潜在社会状态推理上的不足。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30294 2026-09-01 cs.CV 新提交

Dynamic Hub-and-Spoke Memory for Streaming Video Understanding

用于流视频理解的动态轮辐式记忆

Xinru Jiang, Lin Zhao, Xi Xiao, Yunbei Zhang, Janet Wang, Chenrui Ma, Haolin Li, Yanzhi Wang, Yifan Gong, Octavia Camps

机构 * Northeastern University(东北大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Tulane University(杜兰大学) University of Virginia(弗吉尼亚大学) Adobe Research(奥多比研究院)

AI总结 针对流视频理解需同时紧凑记忆长程历史与高效检索相关证据的挑战,提出动态轮辐式记忆(D-HSM)框架,结合结构化文本记忆与近期视觉标记,在基准上提升VLM性能并优于现有基线。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30144 2026-09-01 cs.RO 新提交

Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving

重新思考语言在自动驾驶高效视觉-语言-动作(VLA)模型中的作用:迈向更智能、可信的驾驶

Tongfei Guo, Lili Su

机构 * Northeastern University(东北大学)

AI总结 本研究针对自动驾驶VLA模型的高推理开销问题,提出语言残差分类法梳理高效语言使用方法,在多基准上分析适配性,将发布相关代码仓库。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29809 2026-09-01 cs.CV 新提交

RegionCache: Semantic-Aware Region Reuse for Efficient Multi-Turn Image Generation

RegionCache:面向高效多轮图像生成的语义感知区域复用

Peizheng Li, Xin Ai, Hanyuan Liu, Qiange Wang, Yanfeng Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

AI总结 针对多轮图像编辑中现有DiT方法的冗余计算问题,提出RegionCache框架,通过语义感知的区域复用实现1.43-2.55倍端到端加速且保持图像质量。

Comments Accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29667 2026-09-01 cs.LG 新提交

A Target-Centric Survey of Quantization-Aware Training

以目标为中心的量化感知训练综述

Jiamin Song, Mengjie Zhao, Zijing Wang, Yongkang Liu, Qian Li, Shi Feng, Feiliang Ren, Daling Wang, Hinrich Schütze

机构 * Northeastern University(东北大学) Shandong University(山东大学) LMU Munich(慕尼黑大学) MCML(慕尼黑计算与机器学习中心)

AI总结 该研究针对大型语言模型的高内存与高计算需求问题,开展以目标为中心的量化感知训练(QAT)综述,梳理其理论基础、方法分类、评估范式及挑战,为未来研究指明方向。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29605 2026-09-01 cs.CL 新提交

Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit

事后记忆-PRM:通过可审计的事后信用监督记忆管理

Haoxuan Jia, Yang Liu, Yingguang Yang, Yancheng Chen, Chongyang Zhang, Hao Zheng, Qian Li, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Hao Peng, Junyu Lu, Du Cheng, Philip S. Yu, Bin Chong

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Fullive-AI Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Institute of Technology, Zhuhai(北京理工大学珠海学院) Northeastern University(东北大学) University of Illinois Chicago(芝加哥大学伊利诺伊分校)

AI总结 该研究提出Hindsight Memory-PRM,利用轨迹审计轨迹训练记忆效用评判器并确定代理奖励,在LoCoMo、LongMemEval数据集上的性能优于基线系统,实现高效的长视野LLM智能体记忆管理监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29228 2026-09-01 cs.AI cs.MA 新提交

Localizing Emergent Failures in Agentic AI: Recovering Minimal Repair Families via Counterfactual Replay

智能体AI中涌现故障的定位:通过反事实回放恢复最小修复族

Bingjie Li, Yumeng Song, Zhongming Yao, Tianyi Li

机构 * Northeastern University(东北大学) Aalborg University(奥尔堡大学) Zhejiang University(浙江大学)

AI总结 本研究针对智能体AI中LLM智能体交互引发的涌现故障,提出GCJR方法恢复最小修复族,在基准和试点案例中实现1.000族精确匹配,显著减少回放或模型调用次数。

Comments 6 pages, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28840 2026-09-01 cs.LG 新提交

Unsupervised Latent Space Alignment with Hyperspherical Geodesic Matching

基于超球面测地线匹配的无监督潜在空间对齐

Cameron Ryan, Vivek Sivaraman Narayanaswamy, Kowshik Thopalli, Shusen Liu

机构 * Northeastern University(东北大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

AI总结 该研究提出HGA方法,无需配对样本即可实现潜在空间的无监督对齐,在模型拼接等任务中性能可与有监督方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26638 2026-09-01 cs.CL stat.ML 版本更新

Which Metrics Save the Most Human Annotation? Prediction-Powered Evaluation and Meta-Evaluation

哪些指标能节省最多的人工标注?预测驱动的评估与元评估

Mingqi Gao, Anthony Sicilia, Weiyan Shi

机构 * Northeastern University(东北大学) West Virginia University(西弗吉尼亚大学)

AI总结 该研究基于预测驱动推理提出预测驱动评估框架,引入预测驱动节省率元指标,结合有限人工判断与大规模自动评分实现无偏高效的系统比较,可节省人工标注成本,适用于各类无法验证的任务。

Comments Accepted at EMNLP 2026 (Main). Code available: https://github.com/CHATS-lab/ppi-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25200 2026-09-01 cs.LG cs.AI cs.CL 版本更新

MoPLEx: Estimating Plackett-Luce Mixture Models for Multi-Objective Alignment

学习用于多目标对齐的Plackett-Luce模型混合

Dongyue Li, Ziniu Zhang, Lu Wang, Hongyang R. Zhang

机构 * Northeastern University(东北大学) University of Michigan(密歇根大学)

AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。

Comments 19 pages; To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22676 2026-09-01 cs.AI 版本更新

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

智能体人工智能对不一致和不完整工具响应的鲁棒性分析

Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

机构 * Aalborg University(奥尔堡大学) Zhejiang University(浙江大学) Northeastern University(东北大学)

AI总结 该研究通过在零售客户服务领域注入受控故障,分析智能体AI对不一致、不完整工具响应的鲁棒性,发现两类响应在特定通道中可不对称识别,动作分布特征存在差异。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-09-01 cs.CL cs.AI 版本更新

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13681 2026-09-01 cs.SE cs.AI cs.ET cs.LG 交叉投稿

Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT

微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程

Pu Zhao, Changdi Yang, Yixiao Chen, Yi Gao, Yifan Cao, Haochen Zeng, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc(EmbodyX公司) Aibao LLC(Aibao有限责任公司)

AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02665 2026-09-01 cs.CR cs.AI cs.CL 版本更新

Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

单一规范提示低估了大语言模型安全的表面形式敏感性

Yongxi Zhou, Junwei Yao, Yuanzhe Liu, Zihan Dong, Wenbo Ye, Jiaxi Wen, Lai Yun Choi

机构 * Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) University of Southern California(南加利福尼亚大学)

AI总结 该研究发现仅用单一规范提示评估大语言模型安全会低估其不安全合规性,不同表面形式下的不安全结果并集会超出最糟单一形式,且存在模型差异,同时发布了相关数据集、代码与响应标签。

Comments Accepted at the Sci-FM Workshop @ COLM 2026 (non-archival). Workshop version with reviews: https://openreview.net/forum?id=mZh0MqpOOC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13120 2026-09-01 cs.CL 版本更新

EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge

EvoBrowseComp: 基于演化知识的搜索智能体基准测试

Yunhan Wang, Jiaan Wang, Lianzhe Huang, Xianfeng Zeng, Fandong Meng

机构 * Northeastern University, China(东北大学(中国)) Weixin AI, Tencent Inc, China(腾讯微信AI(中国))

AI总结 提出EvoBrowseComp,一个通过实时网络遍历自动生成400道英文和400道中文无污染复杂问题的演化基准,用于评估搜索智能体在动态知识环境中的真实浏览能力。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01390 2026-09-01 cs.HC cs.AI 版本更新

Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

迈向可扩展的音频描述质量控制:评估人类和VLM评分者的流程

Lana Do, Gio Jung, Juvenal Francisco Barajas, Andrew Taylor Scott, Shasta Ihorn, Alexander Mario Blum, Vassilis Athitsos, Ilmi Yoon

机构 * Northeastern University(东北大学) San Francisco State University(旧金山州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

AI总结 本文提出了一种评估人类和VLM评分者音频描述质量的流程,利用项目反应理论评估其与专家标准的匹配程度,发现VLM在大规模评估中可与人类评分者相当,但其推理可靠性较低。

Comments Accepted to ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04865 2026-09-01 cs.LG cs.PL 版本更新

Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment

Agnostics: 通过通用学习环境的强化学习实现任何编程语言的代码学习

Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha

机构 * Northeastern University(东北大学) University of Texas(德克萨斯大学) Wellesley College(韦尔斯利学院)

AI总结 Agnostics通过通用学习环境的强化学习,实现任何编程语言的代码学习,提升低资源语言模型性能并简化训练流程。

Comments 30 pages, 19 figures. Accepted at ICLR 2026. For data, code, artifacts, see https://agnostics.abgru.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19305 2026-09-01 cs.RO cs.AI cs.CV 版本更新

PhyGile: Physics-Prefix Guided Motion Generation for Agile General Humanoid Motion Tracking

PhyGile: 面向敏捷通用人形运动跟踪的物理前缀引导运动生成

Jiacheng Bao, Haoran Yang, Yucheng Xin, Junhong Liu, Yuecheng Xu, Han Liang, Pengfei Han, Xiaoguang Ma, Dong Wang, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Fudan University(复旦大学) ByteDance(字节跳动) Northeastern University(东北大学)

AI总结 提出PhyGile框架,通过物理前缀引导的机器人原生运动生成,结合课程混合专家训练和后训练,解决文本生成运动在机器人上物理不可行的问题,实现敏捷全身运动跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23147 2026-09-01 cs.LG cs.AI 版本更新

Securing Time Integrity in Energy IoT Against Clock Drift and Y2K38 Failures

保护能源物联网中的时间完整性:应对时钟漂移和Y2K38故障

Saeid Jamshidi, Foutse Khomh, Carol Fung, Omar Abdul Wahab, Rolando Herrero

机构 * Department of Computer and Software Engineering, Polytechnique Montréal(Polytechnique Montréal 计算机与软件工程系) SWAT Laboratory, Polytechnique Montréal(Polytechnique Montréal SWAT 实验室) College of Engineering, Northeastern University(Northeastern University 工程学院) Concordia Institute for Information Systems Engineering (CIISE), Concordia University(Concordia University 信息系统工程研究所)

AI总结 提出STGAT框架,结合漂移感知时间嵌入、时间自注意力和图注意力,检测能源物联网中的时钟漂移、同步偏移和Y2K38溢出等时间异常,准确率达95.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18707 2026-09-01 cs.CL 版本更新

Learning from Many Voices: Literary MT Using Multi-Reference Human and Synthetic Data

从多视角学习:利用多参考人工与合成数据的文学机器翻译

Si Wu, John Wieting, David A. Smith

机构 * Northeastern University(东北大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出基于语义相似度的过滤框架,利用多参考人工与合成数据开展文学机器翻译研究,发现中高语义相似度数据微调效果更优,且人工专家译文的微调效果优于合成数据。

详情

展开后加载摘要…

URL PDF HTML 收藏