arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-04-28 至 2026-04-28 共收录 82
2604.24690 2026-04-28 cs.CL

Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination

LLMs能否成为历史学家?通过中国科举制度评估LLMs的历史研究能力

Lirong Gao, Zeqing Wang, Yuyan Cai, Jiayi Deng, Yanmei Gu, Yiming Zhang, Jia Zhou, Yanfei Zhang, Junbo Zhao

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 本文提出ProHist-Bench基准,基于中国科举制度评估LLMs的历史研究能力,揭示其在复杂历史问题上的不足,旨在推动领域特定推理LLM的发展。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24645 2026-04-28 cs.CL cs.AI

K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology

K-MetBench:一个多维基准,用于细粒度评估气象学中的专家推理、局部性和多模态能力

Soyeon Kim, Cheongwoong Kang, Myeongjin Lee, Eun-Chul Chang, Jaedeok Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) INEEJI Kongju National University(康久国立大学)

AI总结 本文提出K-MetBench,一个基于韩国资格考试的多维基准,揭示了专家推理、逻辑有效性、韩国地理文化理解及领域分析四个维度的差距,发现韩国模型在本地情境中优于大模型。

Comments 39 pages, 32 figures, 14 tables, including appendices. Accepted to Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24559 2026-04-28 cs.CL cs.AI

Aligned Multi-View Scripts for Universal Chart-to-Code Generation

对齐的多视图脚本用于通用图表到代码生成

Zhihan Zhang, Lizi Liao

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息学院)

AI总结 本文提出Chart2NCode数据集和CharLuMA模型,通过多语言监督提升图表到代码生成的可执行性和视觉一致性,优于开源基线并具备竞争力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24515 2026-04-28 cs.CL

SEARCH-R: Structured Entity-Aware Retrieval with Chain-of-Reasoning Navigator for Multi-hop Question Answering

SEARCH-R: 结构化实体感知检索与推理链导航器用于多跳问答

Yuqing Fu, Yimin Deng, Wanyu Wang, Yuhao Wang, Yejing Wang, Hongshi Liu, Yiqi Wang, Xiao Han, Maolin Wang, Guoshuai Zhao, Yi Chang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学) Zhejiang University of Technology(浙江工业大学) Michigan State University(密歇根州立大学) Jilin University(吉林大学)

AI总结 SEARCH-R通过结构化实体感知检索与推理链导航器,解决多跳问答中推理路径生成和知识检索的准确性问题,提升多跳问答性能。

Comments ACL2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24470 2026-04-28 cs.CL

Zero-shot Large Language Models for Automatic Readability Assessment

零样本大语言模型用于自动可读性评估

Riley Grossman, Yi Chen

机构 * New Jersey Institute of Technology(新泽西理工学院)

AI总结 本文提出零样本提示方法用于自动可读性评估,并首次全面评估了使用大语言模型作为无监督方法的性能,通过测试10种不同开源大语言模型在14种不同数据集上的表现,证明了方法在14个数据集中优于先前方法,同时提出LAURAE结合LLM和可读性公式得分提升鲁棒性。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24444 2026-04-28 cs.CL

Can You Make It Sound Like You? Post-Editing LLM-Generated Text for Personal Style

你能让它听起来像你吗?为个人风格进行后编辑LLM生成文本

Connor Baumler, Calvin Bao, Huy Nghiem, Xinchen Yang, Marine Carpuat, Hal Daumé

机构 * III University of Maryland(III 马里兰大学)

AI总结 研究探讨用户通过后编辑LLM生成文本来塑造个人风格的效果,发现后编辑提高了文本与用户自身写作的相似性,但降低了与LLM生成文本的相似性,同时减少了风格多样性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24396 2026-04-28 cs.CV cs.AI

Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation

全局上下文还是局部细节?面向幻觉缓解的自适应视觉 grounding

Yubo Jiang, Xin Yang, Abudukelimu Wuerkaixi, Zheming Yuan, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北航航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北航天门山实验室)

AI总结 本文提出PND框架,通过双路径对比在解码过程中增强视觉真实性,减少幻觉并提升描述细节,无需模型微调。

Comments 9 pages, 8 figures, Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24395 2026-04-28 cs.AI

Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs

以自身声音对齐:用于减轻大型视觉-语言模型幻觉的自我纠正偏好学习

Byeonggeuk Lim, JungMin Yun, Junehyoung Kwon, Kyeonghyun Kim, YoungBin Kim

机构 * Graduate School of Advanced Imaging Sciences, Multimedia and Film(高级影像科学研究生院,多媒体与电影系) Department of Artificial Intelligence(人工智能系)

AI总结 本文提出AVES-DPO框架,通过内在知识生成分布数据,利用共识验证机制诊断幻觉并引导模型自我纠正,有效缓解LVLMs的幻觉问题,仅需5200样本即优于现有基线。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24368 2026-04-28 cs.LG

SAGE: Sparse Adaptive Guidance for Dependency-Aware Tabular Data Generation

SAGE:用于依赖感知表格数据生成的稀疏自适应指导

Shuo Yang, Zheyu Zhang, Bardh Prenkaj, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

AI总结 SAGE通过稀疏动态依赖指导提升表格数据生成的准确性和实用性,实验显示其在多个任务中提升了F1分数10%并减少政策违规。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24361 2026-04-28 cs.CL

Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation

具有文化意识的大型语言模型机器翻译:基准测试与调查

Zekun Yuan, Yangfan Ye, Xiaocheng Feng, Baohang Li, Qichen Hong, Yunfei Lu, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 本文提出CanMT数据集和评估框架,系统评估多种LLM在不同翻译策略下的表现,揭示模型在文化翻译中的性能差异及策略影响,指出文化特定项的翻译难度差异及评估可靠性问题。

Comments 26pages,25 figures ACL2026 main conference, long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24320 2026-04-28 cs.CL

DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents

DPEPO:基于大语言模型代理的多样化并行探索策略优化

Junshuo Zhang, Chengrui Huang, Feng Guo, Zihan Li, Ke Shi, Menghua Jiang, Jiguo Yu, Shuo Shang, Shen Gao

机构 * University of Electronic Science and Technology of China(电子科技大学) DiDi(滴滴)

AI总结 本文提出DPEPO算法,通过并行探索提升大语言模型代理在复杂任务中的性能,实验表明其在ALFWorld和ScienceWorld上达到最先进的成功率。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21380 2026-04-28 cs.SE cs.AI cs.CL

Conjecture and Inquiry: Quantifying Software Performance Requirements via Interactive Retrieval-Augmented Preference Elicitation

猜想与探究:通过交互式检索增强偏好获取量化软件性能需求

Shihai Wang, Tao Chen

机构 * School of Computer Science and Engineering, UESTC(电子科技大学计算机科学与工程学院) IDEAS Lab, University of Birmingham(英国伯明翰大学IDEAS实验室)

AI总结 本文提出IRAP方法,通过交互式检索增强偏好获取将软件性能需求转化为数学函数,实验表明其在五个交互回合内实现最高40倍的性能提升。

Comments 9 pages,accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17703 2026-04-28 cs.MA

Why Are We Moral? An LLM-based Agent Simulation Approach to Study Moral Evolution

为什么我们有道德?一种基于大语言模型的智能体模拟方法研究道德进化

Zhou Ziheng, Huacong Tang, Mingjie Bi, Yipeng Kang, Wanying He, Fang Sun, Yizhou Sun, Ying Nian Wu, Demetri Terzopoulos, Fangwei Zhong

AI总结 本文通过基于大语言模型的智能体模拟方法,探讨道德进化中的合作与互惠机制,发现普遍互惠道德在不同条件下表现稳定,而利己行为被强烈排斥,同时认知因素在道德演化中起关键作用。

Comments Accepted at ACL 2026 Main Conference. 51 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16518 2026-04-28 cs.CL cs.AI

CUB: Benchmarking Context Utilisation Techniques for Language Models

CUB:语言模型上下文利用技术的基准测试

Lovisa Hagström, Youna Kim, Haeun Yu, Sang-goo Lee, Richard Johansson, Hyunsoo Cho, Isabelle Augenstein

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Seoul National University(首尔国立大学) University of Copenhagen(哥本哈根大学) Ewha Womans University(成均馆大学)

AI总结 本文提出CUB基准,用于评估语言模型在不同噪声上下文下的上下文利用技术,发现现有方法在真实场景中存在不足,需更全面的测试。

Comments Accepted at ACL 2026, 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24186 2026-04-28 cs.CL cs.AI

MultiDx: A Multi-Source Knowledge Integration Framework towards Diagnostic Reasoning

MultiDx: 一个面向诊断推理的多源知识整合框架

Yimin Deng, Zhenxi Lin, Yejing Wang, Guoshuai Zhao, Pengyue Jia, Zichuan Fu, Derong Xu, Yefeng Zheng, Xiangyu Zhao, Li Zhu, Xian Wu, Xueming Qian

机构 * Xi’an Jiaotong University(西安交通大学) City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Westlake University(西湖大学)

AI总结 本文提出MultiDx框架,通过多源知识整合提升诊断推理能力,结合网络搜索、病例数据库等多视角证据,生成最终预测。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24175 2026-04-28 cs.CL cs.AI

AdapTime: Enabling Adaptive Temporal Reasoning in Large Language Models

AdapTime:在大语言模型中实现自适应时间推理

Yimin Deng, Yejing Wang, Zhenxi Lin, Zichuan Fu, Guoshuai Zhao, Derong Xu, Yefeng Zheng, Xiangyu Zhao, Xian Wu, Li Zhu, Xueming Qian

机构 * Xi’an Jiaotong University(西安交通大学) City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Westlake University(西湖大学)

AI总结 本文提出AdapTime方法,通过动态执行推理步骤提升大语言模型的时间推理能力,采用重构、重写和复核三步策略,无需外部工具即可增强模型对时间信息的处理能力。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24114 2026-04-28 cs.CL

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

IRIS:交错强化与增量阶段课程用于跨语言数学推理

Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工学院) IIIT Delhi(德里印度理工学院) University of California, San Diego(加州大学圣地亚哥分校) Nanyang Technological University(南洋理工大学) NVIDIA

AI总结 IRIS通过结合逐步增加难度的监督微调与逆课程强化学习,提升多语言数学推理能力,尤其在低资源和双语环境下表现突出。

Comments Accepted in ACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24003 2026-04-28 cs.CL cs.LG

Stabilizing Efficient Reasoning with Step-Level Advantage Selection

通过步骤级优势选择稳定高效推理

Han Wang, Xiaodong Yu, Jialian Wu, Jiang Liu, Ximeng Sun, Mohit Bansal, Zicheng Liu

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 本文提出SAS方法,在步骤层面选择优势,提升推理稳定性与效率,实验显示在多个基准上准确率提升0.86点,推理长度减少16.3%。

Comments Findings of ACL 2026, Code: https://github.com/HanNight/SAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24001 2026-04-28 cs.AI

CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation

CT-FineBench:用于CT报告生成细粒度评估的诊断可信度基准

Ruifeng Yuan, Wanxing Chang, Weiwei Cao, Bowen Shi, Zhongyu Wei, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(沪幻实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 CT-FineBench通过基于问题回答的流程构建,评估CT报告的细粒度事实一致性,优于传统指标,能更敏感地捕捉临床细节错误。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23948 2026-04-28 cs.CL cs.AI

KOMBO: Korean Character Representations Based on the Combination Rules of Subcharacters

KOMBO:基于子字符组合规则的韩文字符表示

SungHo Kim, Juhyeong Park, Yeachan Kim, SangKeun Lee

机构 * Department of Artificial Intelligence, Korea University, Seoul, South Korea(人工智能系,韩国大学,首尔,韩国) Department of Computer Science and Engineering, Korea University, Seoul, South Korea(计算机科学与工程系,韩国大学,首尔,韩国)

AI总结 本文提出KOMBO框架,通过引入韩文发明原理来表示字符,提升了韩文NLP任务的性能,平均超越现有最佳模型2.11%。

Comments Presented at ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23877 2026-04-28 cs.CL

Knowledge Vector of Logical Reasoning in Large Language Models

大语言模型中逻辑推理的知识向量

Zixuan Wang, Yuanyuan Lei

机构 * Department of Computer & Information Science and Engineering(计算机与信息科学与工程系)

AI总结 本文研究了大语言模型中演绎、归纳和溯因推理的知识表示,发现其在线性空间中可独立表示,提出互补子空间约束框架以增强其互补性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23842 2026-04-28 cs.CL cs.AI

Reheat Nachos for Dinner? Evaluating AI Support for Cross-Cultural Communication of Neologisms

重加热的玉米片?评估AI在跨文化新词交流中的支持作用

Dayeon Ki, Yu Hou, Rachel Rudinger, Hal Daumé, Marine Carpuat, Fumeng Yang

机构 * University of Maryland(马里兰大学)

AI总结 研究评估AI工具在帮助非母语者跨文化交流新词中的有效性,通过实验证明AI解释对提升母语者评价的竞争力有最大提升,但非母语者自我评估与实际表现存在偏差。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23813 2026-04-28 cs.CV cs.CL

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

机构 * Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Qwen(阿里巴巴量子计算实验室) Old Dominion University(旧 Dominion 大学)

AI总结 本文提出ShredBench基准,用于评估多模态大语言模型在文档重建任务中的语义推理能力,发现现有模型在处理破碎文档时存在显著性能差距。

Comments ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23809 2026-04-28 cs.CL

LegalDrill: Diagnosis-Driven Synthesis for Legal Reasoning in Small Language Models

LegalDrill: 以诊断驱动合成促进小型语言模型中的法律推理

Tianchun Li, Haochen Liu, Vishwa Pardeshi, Xingchen Wang, Tianci Liu, Huijun Zhao, Wei Fan, Jing Gao

机构 * Purdue University(普渡大学) Fidelity Investments(富达投资)

AI总结 LegalDrill通过精细提示提取并迭代优化教师模型的推理轨迹,结合自我反思验证选择有效数据,提升小型语言模型的法律推理能力,无需稀缺专家标注。

Comments ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23783 2026-04-28 cs.IR cs.AI

S2G-RAG: Structured Sufficiency and Gap Judging for Iterative Retrieval-Augmented QA

S2G-RAG:结构充分性与间隙判断用于迭代检索增强问答

Minghan Li, Junjie Zou, Xinxuan Lv, Chao Zhang, Guodong Zhou

机构 * Soochow University(苏州大学)

AI总结 S2G-RAG通过结构化充分性判断和间隙判断机制,提升多跳问答的准确性和鲁棒性,适用于多轮检索流程。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23779 2026-04-28 cs.IR cs.AI

GLIER: Generative Legal Inference and Evidence Ranking for Legal Case Retrieval

GLIER:生成式法律推理与证据排序用于法律案例检索

Minghan Li, Tianrui Lv, Chao Zhang, Guodong Zhou

机构 * Soochow University(苏州大学)

AI总结 GLIER通过生成式法律推理和证据排序框架,解决法律案例检索中非专业查询与专业文档间的语义鸿沟问题,提升检索的可解释性和准确性。

Comments Accepted to the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23742 2026-04-28 cs.SD

RTCFake: Speech Deepfake Detection in Real-Time Communication

RTCFake: 语音深度伪造检测中的实时通信

Jun Xue, Zhuolin Yi, Yihuan Huang, Yanzhen Ren, Yujie Chen, Cunhang Fan, Zicheng Su, Yonghong Zhang, Bo Cai

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education(航空航天信息安全部与可信计算教育部重点实验室) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Beihang University(北京航空航天大学)

AI总结 本文提出RTCFake数据集,用于实时通信场景下的语音深度伪造检测,结合平台不变语义表征学习策略,提升跨平台泛化能力与噪声鲁棒性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23623 2026-04-28 cs.AI

Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning

Tandem: 大小语言模型协同以实现高效的推理

Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Renmin University of China(中国人民大学) Westlake University(西湖大学)

AI总结 Tandem通过结合大语言模型和小语言模型,减少计算成本并提升推理质量,实验表明其在数学推理和代码生成任务中性能优越。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23588 2026-04-28 cs.AI cs.CL cs.IR

FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification

FinGround:通过原子性声明验证检测和支撑金融幻觉

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

AI总结 FinGround通过三阶段验证-支撑流程,针对金融文档问答中的计算错误进行验证和修正,有效降低幻觉率,其在金融领域具有重要应用价值。

Comments Accepted to ACL 2026 Industry Track. 14 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23585 2026-04-28 cs.CL cs.IR cs.LG

ComplianceNLP: Knowledge-Graph-Augmented RAG for Multi-Framework Regulatory Gap Detection

ComplianceNLP:基于知识图谱的多框架监管缺口检测RAG系统

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

AI总结 ComplianceNLP通过整合知识图谱增强的RAG系统,实现监管变化自动监控、义务提取及合规缺口识别,其在监管缺口检测上达到87.7 F1,优于GPT-4o+RAG,且在实际部署中显著提升分析师效率。

Comments Accepted at ACL 2026 Industry Track. 19 pages, 15 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏