arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Northeastern University(东北大学)

2026-09-01 至 2026-09-01 共收录 11
2608.26638 2026-09-01 cs.CL stat.ML 版本更新

Which Metrics Save the Most Human Annotation? Prediction-Powered Evaluation and Meta-Evaluation

哪些指标能节省最多的人工标注?预测驱动的评估与元评估

Mingqi Gao, Anthony Sicilia, Weiyan Shi

机构 * Northeastern University(东北大学) West Virginia University(西弗吉尼亚大学)

AI总结 该研究基于预测驱动推理提出预测驱动评估框架,引入预测驱动节省率元指标,结合有限人工判断与大规模自动评分实现无偏高效的系统比较,可节省人工标注成本,适用于各类无法验证的任务。

Comments Accepted at EMNLP 2026 (Main). Code available: https://github.com/CHATS-lab/ppi-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25200 2026-09-01 cs.LG cs.AI cs.CL 版本更新

MoPLEx: Estimating Plackett-Luce Mixture Models for Multi-Objective Alignment

学习用于多目标对齐的Plackett-Luce模型混合

Dongyue Li, Ziniu Zhang, Lu Wang, Hongyang R. Zhang

机构 * Northeastern University(东北大学) University of Michigan(密歇根大学)

AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。

Comments 19 pages; To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22676 2026-09-01 cs.AI 版本更新

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

智能体人工智能对不一致和不完整工具响应的鲁棒性分析

Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

机构 * Aalborg University(奥尔堡大学) Zhejiang University(浙江大学) Northeastern University(东北大学)

AI总结 该研究通过在零售客户服务领域注入受控故障,分析智能体AI对不一致、不完整工具响应的鲁棒性,发现两类响应在特定通道中可不对称识别,动作分布特征存在差异。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-09-01 cs.CL cs.AI 版本更新

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02665 2026-09-01 cs.CR cs.AI cs.CL 版本更新

Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

单一规范提示低估了大语言模型安全的表面形式敏感性

Yongxi Zhou, Junwei Yao, Yuanzhe Liu, Zihan Dong, Wenbo Ye, Jiaxi Wen, Lai Yun Choi

机构 * Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) University of Southern California(南加利福尼亚大学)

AI总结 该研究发现仅用单一规范提示评估大语言模型安全会低估其不安全合规性,不同表面形式下的不安全结果并集会超出最糟单一形式,且存在模型差异,同时发布了相关数据集、代码与响应标签。

Comments Accepted at the Sci-FM Workshop @ COLM 2026 (non-archival). Workshop version with reviews: https://openreview.net/forum?id=mZh0MqpOOC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13120 2026-09-01 cs.CL 版本更新

EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge

EvoBrowseComp: 基于演化知识的搜索智能体基准测试

Yunhan Wang, Jiaan Wang, Lianzhe Huang, Xianfeng Zeng, Fandong Meng

机构 * Northeastern University, China(东北大学(中国)) Weixin AI, Tencent Inc, China(腾讯微信AI(中国))

AI总结 提出EvoBrowseComp,一个通过实时网络遍历自动生成400道英文和400道中文无污染复杂问题的演化基准,用于评估搜索智能体在动态知识环境中的真实浏览能力。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01390 2026-09-01 cs.HC cs.AI 版本更新

Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

迈向可扩展的音频描述质量控制:评估人类和VLM评分者的流程

Lana Do, Gio Jung, Juvenal Francisco Barajas, Andrew Taylor Scott, Shasta Ihorn, Alexander Mario Blum, Vassilis Athitsos, Ilmi Yoon

机构 * Northeastern University(东北大学) San Francisco State University(旧金山州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

AI总结 本文提出了一种评估人类和VLM评分者音频描述质量的流程,利用项目反应理论评估其与专家标准的匹配程度,发现VLM在大规模评估中可与人类评分者相当,但其推理可靠性较低。

Comments Accepted to ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04865 2026-09-01 cs.LG cs.PL 版本更新

Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment

Agnostics: 通过通用学习环境的强化学习实现任何编程语言的代码学习

Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha

机构 * Northeastern University(东北大学) University of Texas(德克萨斯大学) Wellesley College(韦尔斯利学院)

AI总结 Agnostics通过通用学习环境的强化学习,实现任何编程语言的代码学习,提升低资源语言模型性能并简化训练流程。

Comments 30 pages, 19 figures. Accepted at ICLR 2026. For data, code, artifacts, see https://agnostics.abgru.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19305 2026-09-01 cs.RO cs.AI cs.CV 版本更新

PhyGile: Physics-Prefix Guided Motion Generation for Agile General Humanoid Motion Tracking

PhyGile: 面向敏捷通用人形运动跟踪的物理前缀引导运动生成

Jiacheng Bao, Haoran Yang, Yucheng Xin, Junhong Liu, Yuecheng Xu, Han Liang, Pengfei Han, Xiaoguang Ma, Dong Wang, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Fudan University(复旦大学) ByteDance(字节跳动) Northeastern University(东北大学)

AI总结 提出PhyGile框架,通过物理前缀引导的机器人原生运动生成,结合课程混合专家训练和后训练,解决文本生成运动在机器人上物理不可行的问题,实现敏捷全身运动跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23147 2026-09-01 cs.LG cs.AI 版本更新

Securing Time Integrity in Energy IoT Against Clock Drift and Y2K38 Failures

保护能源物联网中的时间完整性:应对时钟漂移和Y2K38故障

Saeid Jamshidi, Foutse Khomh, Carol Fung, Omar Abdul Wahab, Rolando Herrero

机构 * Department of Computer and Software Engineering, Polytechnique Montréal(Polytechnique Montréal 计算机与软件工程系) SWAT Laboratory, Polytechnique Montréal(Polytechnique Montréal SWAT 实验室) College of Engineering, Northeastern University(Northeastern University 工程学院) Concordia Institute for Information Systems Engineering (CIISE), Concordia University(Concordia University 信息系统工程研究所)

AI总结 提出STGAT框架,结合漂移感知时间嵌入、时间自注意力和图注意力,检测能源物联网中的时钟漂移、同步偏移和Y2K38溢出等时间异常,准确率达95.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18707 2026-09-01 cs.CL 版本更新

Learning from Many Voices: Literary MT Using Multi-Reference Human and Synthetic Data

从多视角学习:利用多参考人工与合成数据的文学机器翻译

Si Wu, John Wieting, David A. Smith

机构 * Northeastern University(东北大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出基于语义相似度的过滤框架,利用多参考人工与合成数据开展文学机器翻译研究,发现中高语义相似度数据微调效果更优,且人工专家译文的微调效果优于合成数据。

详情

展开后加载摘要…

URL PDF HTML 收藏