arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-04-17 至 2026-04-17 共收录 72
2511.01014 2026-04-17 cs.CL

IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation

IF-CRITIC:面向指令遵循评估的细粒度LLM批评者

Bosi Wen, Yilin Niu, Cunxiang Wang, Pei Ke, Xiaoying Ling, Ying Zhang, Aohan Zeng, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) University of Electronic Science and Technology of China(电子科技大学) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))

AI总结 本文提出IF-CRITIC,通过细粒度、高效且可靠的评估方法提升LLM指令遵循能力,采用检查清单生成器和约束级偏好优化训练模型,实验表明其优于现有基线模型。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26109 2026-04-17 cs.LG

Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error

不要踏进同一条河两次:从试错中学习推理

Chenming Tang, Hsiu-Yuan Huang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(国家多媒体信息处理重点实验室) School of Computer Science(计算机学院) LLM Department, Tencent(腾讯LLM部门)

AI总结 本文提出LTE方法,通过提示模型自身之前的错误来提升推理能力,优于传统方法并在多个数学推理基准上表现更佳。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24284 2026-04-17 cs.AI

MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools

MCP-Flow:帮助LLM代理掌握现实世界、多样且可扩展的MCP工具

Wenhao Wang, Peizhi Niu, Zhao Xu, Zhaoyu Chen, Jian Du, Yaxin Du, Xianghe Pang, Keduan Huang, Yanfeng Wang, Qiang Yan, Siheng Chen

机构 * TikTok Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 MCP-Flow通过自动化流程提升LLM在现实世界MCP环境中的能力,通过大规模服务器发现、数据合成和模型训练,生成高质量指令-功能调用对和轨迹,推动代理任务性能提升。

Comments ACL 2026 Main, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23853 2026-04-17 cs.CL

Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time Perception

你的LLM代理是时间盲的:工具使用决策与人类时间感知之间的不一致

Yize Cheng, Arshia Soltani Moakhar, Chenrui Fan, Parsa Hosseini, Kazem Faghih, Zahra Sodagar, Wenxiao Wang, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 研究揭示LLM代理在动态环境中因时间感知不足导致的工具调用偏差,通过TicToc数据集分析发现现有模型与人类时间感知对齐率低,提出通过后训练对齐提升多轮对话中工具使用与人类时间感知的一致性。

Comments ACL 2026 (findings), Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20151 2026-04-17 cs.CL

BoundRL: Efficient Structured Text Segmentation through Reinforced Boundary Generation

BoundRL: 通过强化边界生成实现高效的结构化文本分段

Haoyuan Li, Zhengyuan Shen, Sullam Jeoung, Yueyan Chen, Jiayu Li, Qi Zhu, Shuai Wang, Vassilis Ioannidis, Huzefa Rangwala

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Amazon Web Services(亚马逊网络服务)

AI总结 本文提出BoundRL,一种高效处理长结构化文本的分段与标签预测方法,通过强化学习优化文档重建和语义对齐,减少输出token并降低幻觉风险,实验证明其在复杂提示下优于其他基线方法。

Comments accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08483 2026-04-17 cs.CL cs.AI

DeepPrune: Parallel Scaling without Inter-trace Redundancy

DeepPrune: 无需跨轨迹冗余的并行扩展

Shangqing Tu, Yaxuan Li, Yushi Bai, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出DeepPrune框架,通过动态剪枝解决并行推理中的冗余问题,实现65.73%-88.50%的token减少,保持高精度。

Comments Accepted by ACL 2026 Findings, please check out the project page: https://deepprune.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05486 2026-04-17 cs.CL

Language Model as Planner and Formalizer under Constraints

语言模型作为规划器和形式化工具的约束下

Cassie Huang, Stuti Mohan, Ziyi Yang, Stefanie Tellex, Li Zhang

机构 * Drexel University(德雷塞尔大学) Brown University(布朗大学)

AI总结 研究通过引入细粒度自然语言约束,揭示语言模型在规划任务中的性能下降,指出其鲁棒性不足及未来研究方向。

Comments In ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09457 2026-04-17 cs.CL cs.LG

Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms

朝着弥合直接对齐算法中的奖励生成差距而努力

Zeguan Xiao, Yun Chen, Guanhua Chen, Ke Tang

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

AI总结 本文探讨了直接对齐算法中奖励生成差距的问题,提出Prefix-Oriented Equal-length Training方法,通过截断响应长度来提升对齐效果,实验显示在AlpacaEval 2上提升显著。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03487 2026-04-17 cs.IR cs.CL

ProRank: Prompt Warmup via Reinforcement Learning for Small Language Models Reranking

ProRank:通过强化学习进行小语言模型的提示预热以实现文档重排序

Xianming Li, Aamir Shakir, Rui Huang, Tsz-fung Andrew Lee, Julius Lipp, Benjamin Clavié, Jing Li

机构 * Mixedbread AI The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出ProRank方法,通过强化学习提升小语言模型对任务提示的理解,结合细粒度分数学习增强表示能力,实验证明其在文档重排序任务中优于现有模型,尤其在BEIR基准上表现突出。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14838 2026-04-17 cs.DL cs.AI

In-depth Research Impact Summarization through Fine-Grained Temporal Citation Analysis

通过细粒度时间引文分析进行深入研究影响总结

Hiba Arnaout, Noy Sternlicht, Tom Hope, Iryna Gurevych

机构 * UKP Lab, TU Darmstadt and Hessian Center for AI (hessian.AI)(图腾实验室,达姆施塔特技术大学及海德堡人工智能中心) School of Computer Science and Engineering, Hebrew University of Jerusalem(耶路撒冷希伯来大学计算机科学与工程学院) The Allen Institute for AI (AI2)(人工智能研究所(AI2))

AI总结 本文提出生成细粒度时间引文分析的影响力摘要,通过引文意图的演变捕捉褒贬,引入评估框架,显示在主观指标上的人类相关性,并获得专家反馈。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16761 2026-04-17 cs.CL

Language Model Fine-Tuning on Scaled Survey Data for Predicting Distributions of Public Opinions

基于扩展调查数据的语言模型微调以预测公众意见分布

Joseph Suh, Erfan Jahanparast, Suhong Moon, Minwoo Kang, Serina Chang

机构 * University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院)

AI总结 本文通过微调大型语言模型,利用调查数据的结构特性提升对公众意见分布的预测能力,实验显示在多种子群体中模型预测与人类响应的匹配度显著提高,且能泛化到未见过的调查和子群体。

Comments ACL 2025 Long Main (https://aclanthology.org/2025.acl-long.1028/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14751 2026-04-17 cs.CL

Query pipeline optimization for cancer patient question answering systems

癌症患者问答系统中的查询管道优化

Maolin He, Rena Gao, Mike Conway, Brian E. Chapman

机构 * School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院) Health Data Science and Biostatistics, University of Texas Southwestern Medical Center(德克萨斯西南医学中心健康数据科学与生物统计学)

AI总结 本文提出了一种针对癌症患者问答系统的RAG查询管道三方面优化方法,通过改进文档检索、段落检索和语义表示,提升了回答准确性。

Comments This paper has been accepted as a Findings Paper in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏