arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2601.02944 2026-04-20 eess.AS

XLSR-MamBo: Scaling the Hybrid Mamba-Attention Backbone for Audio Deepfake Detection

XLSR-MamBo:用于音频深度伪造检测的混合Mamba-注意力骨干网络的扩展

Kwok-Ho Ng, Tingting Song, Yongdong Wu, Zhihua Xia

AI总结 本文提出XLSR-MamBo框架,通过整合XLSR前端与协同Mamba-Attention骨干,提升音频深度伪造检测性能,实验表明其在多个基准测试中表现优异。

Comments 11 pages, 3 figures, Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02626 2026-04-20 cs.CL

Understanding New-Knowledge-Induced Factual Hallucinations in LLMs: Analysis and Interpretation

理解大语言模型中新知识诱导的事实幻觉:分析与解释

Renfei Dang, Peng Hu, Zhejian Lai, Changjiang Gao, Min Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Huawei Translation Services Center(华为翻译服务中心)

AI总结 研究探讨了新知识微调导致的大语言模型事实幻觉现象,通过设计Biography-Reasoning数据集,分析不同知识类型和任务类型中的幻觉表现,发现知识类型中不熟悉程度是幻觉的主要驱动因素。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22977 2026-04-20 cs.LG cs.AI

The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination

推理陷阱:增强大语言模型推理能力如何放大工具幻觉

Chenlong Yin, Zeyang Sha, Shiwen Cui, Changhua Meng, Zechao Li

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Nanjing University of Science and Technology(南京理工大学) Independent Researcher(独立研究者)

AI总结 研究探讨增强LLM推理能力是否导致工具幻觉增加,通过SimpleToolHalluBench验证因果关系,发现推理增强与幻觉成正比,且不受过拟合影响,揭示需新的训练目标平衡能力和可靠性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25300 2026-04-20 cs.LG cs.AI

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23714 2026-04-20 cs.CL

Collaboration of Fusion and Independence: Hypercomplex-driven Robust Multi-Modal Knowledge Graph Completion

融合与独立的协作:超复数驱动的鲁棒多模态知识图谱补全

Zhiqiang Liu, Yichi Zhang, Mengshu Sun, Lei Liang, Wen Zhang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-Ant Group Joint Lab of Knowledge Graph(浙大蚂蚁集团知识图谱联合实验室) Ant Group(蚂蚁集团)

AI总结 本文提出M-Hyper方法,结合融合与独立模态表示,利用四元数代数实现多模态交互,提升知识图谱补全的鲁棒性和效率。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06094 2026-04-20 cs.CL

ConlangCrafter: Constructing Languages with a Multi-Hop LLM Pipeline

ConlangCrafter:基于多跳LLM流水线的语言构建

Morris Alper, Moran Yanuka, Raja Giryes, Gašper Beguš

机构 * Tel Aviv University(特拉维夫大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(伯克利大学)

AI总结 本文提出ConlangCrafter,通过多阶段流水线实现语言构建,利用LLM的元语言能力生成一致且多样化的构想语言。

Comments Accepted to ACL 2026. Project page: https://conlangcrafter.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19563 2026-04-20 cs.AI cs.CL

TabularMath: Understanding Math Reasoning over Tables with Large Language Models

TabularMath: 通过大规模语言模型理解表格上的数学推理

Shi-Yu Tian, Zhi Zhou, Wei Dong, Kun-Yang Yu, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

AI总结 本文提出TabularMath基准,通过神经符号框架将数学问题转化为可扩展的表格推理任务,揭示表格复杂度、质量及表征对推理性能的影响,发现低质量表格对当前LLM的可靠性构成严重风险。

Comments Accepted by ACL 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15549 2026-04-20 cs.CL

WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback

WildFeedback: 对齐大语言模型与实时用户交互与反馈

Taiwei Shi, Zhuoer Wang, Longqi Yang, Ying-Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao, Xiaofeng Xu, Xia Song, Jennifer Neville

机构 * Microsoft Corporation(微软公司) Purdue University(普渡大学) Texas A&M University(德克萨斯农工大学) University of California San Diego(加州大学圣地亚哥分校) University of Southern California(南加州大学)

AI总结 本文提出WildFeedback框架,通过实时用户反馈自动创建偏好数据集,提升大语言模型对用户偏好的对齐能力,解决了现有方法的可扩展性、主观性和偏见问题。

Comments ACL 2026 Camera-ready. 25 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03038 2026-04-20 cs.LG cs.AI cs.CL

Automatic Combination of Sample Selection Strategies for Few-Shot Learning

少样本学习中样本选择策略的自动组合

Branislav Pecher, Ivan Srba, Maria Bielikova, Joaquin Vanschoren

机构 * Faculty of Information Technology, Brno University of Technology(布拉格技术学院,布拉格技术大学) Kempelen Institute of Intelligent Technologies(智能技术研究所) Eindhoven University of Technology(埃因霍温技术大学)

AI总结 本文提出ACSESS方法,通过结合多种样本选择策略提升少样本学习性能,实验显示组合策略优于单一策略,且在小数据集上效果更佳。

Comments Accepted to the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16004 2026-04-20 cs.CL cs.AI

AgentV-RL: Scaling Reward Modeling with Agentic Verifier

AgentV-RL: 通过代理验证器扩展奖励建模

Jiazheng Zhang, Ziche Fu, Zhiheng Xi, Wenqing Jing, Mingxu Chai, Wei He, Guoqiang Zhang, Chenghao Fan, Chenxin An, Wenxiang Chen, Zhicheng Liu, Haojie Pan, Dingwei Zhu, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

AI总结 本文提出Agentic Verifier框架,通过多轮工具增强的反思过程提升奖励建模效果,实验显示其在并行和顺序TTS任务中表现优异,4B变体超越现有最优ORMs 25.2%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15873 2026-04-20 cs.CL

How Hypocritical Is Your LLM judge? Listener-Speaker Asymmetries in the Pragmatic Competence of Large Language Models

你的LLM裁判有多虚伪?大型语言模型在语用能力中的听众-说话人不对称性

Judith Sieker, Sina Zarrieß

机构 * Computational Linguistics, Department of Linguistics(计算语言学系,语言学系)

AI总结 本文研究了大型语言模型在语用能力中的听众与说话人角色差异,发现模型在作为听众判断语言输出适当性时表现优于作为说话人生成语用恰当语言,揭示了当前LLM在语用判断与生成方面的弱关联性。

Comments Accepted at ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15866 2026-04-20 cs.CL cs.AI cs.LG

DiZiNER: Disagreement-guided Instruction Refinement via Pilot Annotation Simulation for Zero-shot Named Entity Recognition

DiZiNER:通过试点注释模拟的分歧引导指令细化用于零样本命名实体识别

Siun Kim, Hyung-Jin Yoon

机构 * Seltasquare Seoul, Korea(首尔韩国Seltasquare) Seoul National University College of Medicine(首尔国立大学医学院) Biomedical Research Institute, Seoul National University Hospital(首尔国立大学医院生物医学研究所)

AI总结 DiZiNER通过模拟试点注释过程,利用LLM作为标注者和监督者,通过多模型标注和分歧分析优化指令,实现零样本NER的SOTA结果,提升F1分数并缩小与监督系统差距。

Comments 9 pages, 3 figures; Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15847 2026-04-20 cs.CL

CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization

CiPO:通过迭代偏好优化实现大型推理模型的反事实去学习

Junyi Li, Yongqiang Chen, Ningning Ding

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对大型推理模型去学习难题,CiPO通过迭代偏好优化重新定义去学习为对推理过程的针对性干预,有效去除中间推理步骤和最终答案的知识,同时保持推理能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15840 2026-04-20 cs.CL

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

CoEvolve:通过代理-数据互演训练LLM代理

Shidong Yang, Ziyu Ma, Tongwen Huang, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) AMAP

AI总结 本文提出CoEvolve框架,通过闭环交互训练提升LLM代理性能,利用反馈信号识别失败模式并指导任务合成,实验显示在AppWorld和BFCL上显著提升表现。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15839 2026-04-20 cs.AI cs.CL cs.LO

Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4

发现与证明:一个开源代理框架用于Lean 4中的硬模式自动定理 proving

Chengwu Liu, Yichun Yin, Ye Yuan, Jiaxuan Xie, Botao Li, Siqi Li, Jianhao Shen, Yan Xu, Lifeng Shang, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

AI总结 本文提出DAP框架,通过LLM自然语言推理与自我反思发现答案,并将硬模式问题转换为易模式问题以提升自动定理证明性能,实现了CombiBench和PutnamBench上的显著提升。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15741 2026-04-20 cs.CL cs.AI

Learning Uncertainty from Sequential Internal Dispersion in Large Language Models

从大型语言模型中的序列内部分散性中学习不确定性

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Centre for AI Research, VinUniversity(Vin大学人工智能研究中心)

AI总结 本文提出SIVR框架,通过利用隐藏状态中的token和层级特征,以更基本的假设来估计不确定性,从而提高hallucination检测的准确性和泛化能力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15717 2026-04-20 cs.CR

Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries

进入灰色区域:领域上下文可以模糊大语言模型安全边界

Ki Sen Hung, Xi Yang, Chang Liu, Haoran Li, Kejiang Chen, Changxuan Fan, Tsun On Kwok, Weiming Zhang, Xiaomeng Li, Yangqiu Song

AI总结 研究探讨了领域上下文如何模糊大语言模型的安全边界,提出Jargon框架通过多轮对抗交互提升攻击成功率,通过激活空间分析揭示灰色区域的不可靠性,并设计政策引导的防护策略以减少攻击成功率。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15710 2026-04-20 cs.SD

VoxMind: An End-to-End Agentic Spoken Dialogue System

VoxMind:一个端到端的智能语音对话系统

Tianle Liang, Yifu Chen, Shengpeng Ji, Yijun Chen, Zhiyang Jia, Jingyu Lu, Fan Zhuo, Xueyi Pu, Yangzhuo Li, Zhou Zhao

机构 * Zhejiang University(浙江大学) China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Xiamen University(厦门大学)

AI总结 本文提出VoxMind,通过引入智能代理能力,提升端到端语音对话系统在复杂任务中的表现,实验表明其任务完成率显著提高。

Comments Accepted to ACL 2026 Main Conference.Code and data available at https://github.com/MM-Speech/VoxMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15687 2026-04-20 cs.CL

Preference Estimation via Opponent Modeling in Multi-Agent Negotiation

通过对手建模进行多智能体谈判中的偏好估计

Yuta Konishi, Kento Yamamoto, Eisuke Sonomoto, Rikuho Takeda, Ryo Furukawa, Yusuke Muraki, Takafumi Shimizu, Kazuma Fukumura, Yuya Kanemoto, Takayuki Ito, Shiyao Ding

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院) Accenture Japan Ltd(Accenture日本公司)

AI总结 本文提出一种整合自然语言信息的结构化贝叶斯对手建模框架,提升多智能体谈判中的偏好估计准确性与一致性。

Comments This paper is accepted as a Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15607 2026-04-20 cs.CL cs.AI cs.CY cs.HC

Imperfectly Cooperative Human-AI Interactions: Comparing the Impacts of Human and AI Attributes in Simulated and User Studies

不完全合作的人机交互:在模拟和用户研究中比较人类和AI属性的影响

Myke C. Cohen, Mingqian Zheng, Neel Bhandari, Hsien-Te Kao, Xuhui Zhou, Daniel Nguyen, Laura Cassani, Maarten Sap, Svitlana Volkova

机构 * Aptima, Inc.(Aptima公司) Arizona State University(亚利桑那州立大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究通过模拟和用户实验比较人类和AI属性在不完全合作场景中的影响,发现AI属性,尤其是透明度,在真实用户研究中更具影响力。

Comments Will be presented at ACL 2026 and published in the Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15588 2026-04-20 cs.CL cs.AI cs.HC cs.LG

"Excuse me, may I say something..." CoLabScience, A Proactive AI Assistant for Biomedical Discovery and LLM-Expert Collaborations

请问,我可以发言吗... CoLabScience,一种用于生物医学发现和LLM专家协作的主动AI助手

Yang Wu, Jinhong Yu, Jingwei Xiong, Zhimin Tao, Xiaozhong Liu

机构 * Worcester Polytechnic Institute(沃斯特理工大学) University of California, Davis(加州大学戴维斯分校) Jiangsu University(江苏大学)

AI总结 本文提出CoLabScience,一种主动AI助手,通过及时的上下文感知干预提升生物医学领域AI与人类专家的协作效率,PULI框架在流式科学讨论中实现精准干预,实验表明其在干预精度和协作任务实用性上优于现有基线。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15488 2026-04-20 cs.LG cs.AI cs.CL

FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models

FineSteer: 一种用于大语言模型推理时细粒度引导的统一框架

Zixuan Weng, Jinghuai Zhang, Kunlin Cai, Ying Li, Peiran Wang, Yuan Tian

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出FineSteer框架,通过条件引导和细粒度向量合成两个阶段实现高效引导,保留模型效用并提升引导效果,实验显示其在安全性和真实性基准上表现优异。

Comments Accepted by ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15383 2026-04-20 cs.SD cs.AI

Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models

时间对比解码:一种无训练方法用于大型音频-语言模型

Yanda Li, Yuhan Liu, Zirui Song, Yunchao Wei, Martin Takáč, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出时间对比解码方法,通过对比原始和模糊的输入路径来减少时间平滑偏差,提升音频基础输出的精确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15301 2026-04-20 cs.CV

Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation

在潜在思想中思考:一种无手势词的签语翻译新范式

Yiyang Jiang, Li Zhang, Xiao-Yong Wei, Li Qing

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

AI总结 本文提出一种基于推理的签语翻译框架,通过潜在思想序列作为中间层提升翻译的连贯性和准确性,并构建了一个新的大规模无手势词数据集。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14646 2026-04-20 cs.AI

Targeted Exploration via Unified Entropy Control for Reinforcement Learning

通过统一熵控制实现定向探索的强化学习

Chen Wang, Lai Wei, Yanzhi Zhang, Chenyang Shao, Zedong Dan, Weiran Huang, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Sun Yat-sen Univeristy(中山大学)

AI总结 本文提出UEC-RL框架,通过定向探索机制和稳定器解决强化学习中的熵崩溃问题,提升大模型推理性能。

Comments Accepted for publication in Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13846 2026-04-20 cs.CL

Beyond Static Personas: Situational Personality Steering for Large Language Models

超越静态人设:面向大语言模型的情境性人格引导

Zesheng Wei, Mengxiang Li, Zilei Wang, Yang Deng

机构 * University of Science and Technology of China(中国科学技术大学) Singapore Management University(新加坡国立大学)

AI总结 本文提出IRIS框架,通过分析人设神经元揭示情境依赖性,实现无训练的神经元引导方法,在PersonalityBench和SPBench上验证了其在复杂情境下的泛化与鲁棒性。

Comments Accepted to Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11182 2026-04-20 cs.CL

Evaluating Memory Capability in Continuous Lifelog Scenario

在连续生活日志场景中评估记忆能力

Jianjie Zheng, Zhichen Liu, Zhanyu Shen, Jingxiang Qu, Guanhua Chen, Yile Wang, Yang Xu, Yang Liu, Sijie Cheng

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Shenzhen University(深圳大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出LifeDialBench基准,包含EgoMem和LifeMem两个子集,通过在线评估协议解决传统离线设置的时序泄漏问题,发现复杂记忆系统不如简单RAG基线表现,强调高保真上下文保存的重要性。

Comments 27 pages, 7 figures. ACL 2026 Findings camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05552 2026-04-20 cs.CL cs.AI

Context-Agent: Dynamic Discourse Trees for Non-Linear Dialogue

上下文代理:非线性对话的动态 discourse 树

Junan Hu, Shudan Guo, Wenqi Liu, Jianhua Yin, Yinwei Wei

机构 * Shandong University(山东大学)

AI总结 本文提出 Context-Agent 框架,通过动态树结构建模对话历史,解决非线性对话中的上下文管理问题,并引入 NTM 评估基准,提升多轮对话任务完成率和效率。

Comments 14 pages, 7 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11698 2026-04-20 cs.CV cs.AI cs.CL

OSCBench: Benchmarking Object State Change in Text-to-Video Generation

OSCBench:文本到视频生成中对象状态变化的基准测试

Xianjing Han, Bin Zhu, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

AI总结 本文提出OSCBench基准,用于评估文本到视频模型在对象状态变化上的性能,揭示当前模型在处理新场景时的不足。

Comments ACL 2026 Main Conference, Project page: https://hanxjing.github.io/OSCBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01566 2026-04-20 cs.CL

FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents

FS-Researcher:基于文件系统的长周期研究任务测试时扩展

Chiwei Zhu, Benfeng Xu, Mingxuan Du, Shaohan Wang, Xiaorui Wang, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(MetaStone技术公司)

AI总结 本文提出FS-Researcher框架,通过持久化工作空间实现长周期研究任务的测试时扩展,采用双代理结构提升研究质量与扩展性。

Comments 22 pages, 6 figures; Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏