arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

至 收录 10293
2601.13024 2026-07-22 cs.CL 版本更新

Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses

眼泪还是欢呼?通过文化诱发的差异情感反应基准测试LLMs

Chongyuan Dai, Yaling Shen, Zihan Gao, Jia Li, Yishun Jiang, Yaxiong Wang, Liu Liu, Zongyuan Ge, Jinpeng Hu

机构 * Hefei University of Technology(合肥工业大学) Monash University(墨尔本大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出CEDAR基准,通过文化诱发的差异情感反应评估LLMs,揭示语言一致性和文化契合度之间的脱节,展示文化根植的情感理解仍是模型的重大挑战。

Comments ACL 2026 SAC Highlight

URL PDF HTML 收藏
2508.06374 2026-07-22 cs.CL 版本更新

Evaluating Style-Personalized Text Generation: Challenges and Directions

评估风格个性化文本生成:挑战与方向

Anubhav Jangra, Bahareh Sarrafzadeh, Silviu Cucerzan, Adrian de Wynter, Sujay Kumar Jauhar

机构 * Columbia University(哥伦比亚大学) Microsoft(微软公司) The University of York(约克大学)

AI总结 研究风格个性化文本生成面临的挑战,通过提出的风格判别基准评估常用指标,发现多样评估指标集成效果更佳,为可靠评估该文本生成提供指导。

Comments Accepted to the 5th GEM workshop at ACL 2026

URL PDF HTML 收藏
1905.05529 2026-07-22 cs.CL 版本更新

Entity-Relation Extraction as Multi-Turn Question Answering

将实体关系提取作为多轮问答

Xiaoya Li, Fan Yin, Zijun Sun, Xiayu Li, Arianna Yuan, Guoyin Wang, Duo Chai, Mingxin Zhou, Jiwei Li

机构 * Computer Science Department, Stanford University(计算机科学系,斯坦福大学)

AI总结 研究提出将实体关系提取转化为多轮问答的新范式,利用问题查询信息、联合建模并借助机器阅读理解模型,在多个数据集上显著优于先前模型,在新构建的中文数据集RESUME上也表现最佳。

Comments to appear at ACL2019

URL PDF HTML 收藏
2604.21370 2026-07-21 cs.CL cs.CY 版本更新

MKJ at SemEval-2026 Task 9: A Comparative Study of Generalist, Specialist, and Ensemble Strategies for Multilingual Polarization

MKJ在SemEval-2026任务9中的表现:多语言极化检测中通用、专业和集成策略的比较研究

Maziar Kianimoghadam Jouneghani

机构 * University of Turin(都灵大学)

AI总结 本文比较了多语言极化检测中通用、专业和集成策略的效果,探讨了多语言通用模型与语言特定专家模型的差异,以及在不同语言任务中的表现。

Comments 9 pages, 9 tables. Published in Proceedings of the 20th International Workshop on Semantic Evaluation (SemEval-2026), Task 9

Journal ref Proceedings of the 20th International Workshop on Semantic Evaluation (SemEval-2026), pages 1398-1406, San Diego, California, USA, July 2026. Association for Computational Linguistics

URL PDF HTML 收藏
2601.02531 2026-07-21 cs.CL cs.AI

Losses that Cook: Topological Optimal Transport for Structured Recipe Generation

让烹饪失败:用于结构化食谱生成的拓扑最优传输

Mattia Ottoborgo, Daniele Rege Cambrin, Paolo Garza

机构 * Trustpilot Politecnico di Torino(托里诺理工学院)

AI总结 本文提出拓扑损失用于生成结构化食谱,提升食材和步骤的准确性,同时改进时间与温度的精确度,实验表明模型在多个指标上表现优异。

Comments Accepted to ACL 2026 Findings

URL PDF HTML 收藏
2601.03481 2026-07-21 cs.CL 版本更新

Self-Explaining Hate Speech Detection with Moral Rationales

基于道德依据的自解释仇恨言论检测

Francielle Vargas, Jackson Trager, Diego Alves, Surendrabikram Thapa, Matteo Guida, Berk Atil, Daryna Dementieva, Andrew Smart, Ameeta Agrawal

机构 * University of São Paulo(圣保罗大学) University of Southern California(南加州大学) Saarland University(萨尔兰大学) Virginia Tech(弗吉尼亚理工大学) University of Melbourne(墨尔本大学) Pennsylvania State University(宾夕法尼亚州立大学) Technical University of Munich(慕尼黑技术大学) Google Research(谷歌研究) Portland State University(波特兰州立大学)

AI总结 研究针对现有仇恨言论检测模型的不足,提出SMRA框架,将道德依据监督融入训练目标,引入新数据集。该框架在检测任务中提升性能,增强解释,且公平性稳定。

Comments This paper was published at Findings of the Association for Computational Linguistics: ACL 2026 (https://aclanthology.org/2026.findings-acl.1704/)

URL PDF HTML 收藏
2509.00930 2026-07-21 cs.AI cs.LG cs.LO 版本更新

SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs

SATQuest:用于大语言模型逻辑推理评估和强化微调的验证器

Yanxiao Zhao, Yaqian Li, Zihao Bo, Rinyoichi Takezoe, Haojia Hui, Mo Guang, Lei Ren, Xiaolin Qin, Kaiwen Long

机构 * Chengdu Institute of Computer Applications, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

AI总结 研究旨在为大语言模型逻辑推理评估及强化微调提供工具。核心方法是SATQuest,它能从CNF实例生成推理任务并客观检查答案,从多维度评估。主要贡献是通过该工具发现模型逻辑推理差距,证明强化微调有效果但跨格式鲁棒性待提升,还提供了相关研究基础设施。

Comments 23 pages, 8 figures. ACL 2026 Main Conference long paper (oral presentation)

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 2109-2131. Association for Computational Linguistics, 2026

URL PDF HTML 收藏
2509.00446 2026-07-21 cs.AI 版本更新

Benchmarking Agentic Newswriting via Journalistic Workflows

通过新闻工作流程对智能新闻写作进行基准测试

Yen-Che Chien, Kuang-Da Wang, Wei-Yao Wang, Wen-Chih Peng

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Sony Group Corporation(索尼集团)

AI总结 研究智能体在新闻写作工作流程中的表现,引入NEWSAGENT基准,给定写作指令和部分材料,评估智能体搜索、选信息及改草稿能力,发现其检索事实尚可,但规划和叙事整合有困难,为评估智能体能力提供现实测试平台。

Comments Accepted to Findings of ACL 2026

URL PDF HTML 收藏
2508.10848 2026-07-21 cs.CL 版本更新

Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning

Psyche-R1:通过统一的同理心、专业知识和推理实现可靠的心理语言模型

Chongyuan Dai, Jinpeng Hu, Hongchang Shi, Zhuo Li, Dan Guo, Xun Yang, Meng Wang

AI总结 研究旨在将大语言模型应用于心理领域,提出Psyche-R1模型。通过设计数据合成管道生成大量心理问题及对话,采用混合训练策略,经实验验证该模型在多个心理基准测试中有效,7B的Psyche-R1能取得与671B的DeepSeek-R1相当的结果。

Comments ACL 2026

URL PDF HTML 收藏
2506.21961 2026-07-21 cs.CL 版本更新

PapersPlease: A Benchmark for Evaluating Motivational Values of Large Language Models Based on ERG Theory

《请出示文件:基于ERG理论评估大语言模型动机价值的基准》

Junho Myung, Yeon Su Park, Sunwoo Kim, Shin Yoo, Alice Oh

AI总结 该研究引入PapersPlease基准,由3700个基于ERG理论的道德困境组成,让LLMs充当移民检查员决策。分析六个LLMs发现决策模式及隐含偏好,评估还显示其对社会身份叙述的反应因动机需求和身份线索而异。

Comments Accepted to GEM2 Workshop: Generation, Evaluation & Metrics - ACL 2025

URL PDF HTML 收藏
2405.12775 2026-07-21 cs.MM cs.AI cs.CL 版本更新

Unsupervised Multimodal Clustering for Semantics Discovery in Multimodal Utterances

用于多模态话语语义发现的无监督多模态聚类

Hanlei Zhang, Hua Xu, Fei Long, Xin Wang, Kai Gao

机构 * State Key Laboratory of Intelligent Technology and Systems, Department of Computer Science and Technology, Tsinghua University(智能技术与系统国家重点实验室,计算机科学与技术系,清华大学) School of Information Science and Engineering, Hebei University of Science and Technology(信息科学与工程学院,河北科技大学) Samton (Jiangxi) Technology Development Co.,Ltd(江西松通科技发展有限公司)

AI总结 本文针对多模态话语语义发现问题,提出无监督多模态聚类方法UMC。通过构建增强视图预训练、动态选样及自动确定参数优化样本选择,在基准数据集上实验,UMC比现有方法聚类指标提升2-7%,取得开创性成果。

Comments Accepted by ACL 2024, Main Conference, Long Paper

URL PDF HTML 收藏
2311.10781 2026-07-21 cs.CL cs.AI

Can Language Model Moderators Improve the Health of Online Discourse?

语言模型调解者能否改善在线讨论的健康状况?

Hyundong Cho, Shuai Liu, Taiwei Shi, Darpan Jain, Basem Rizk, Yuyang Huang, Zixun Lu, Nuan Wen, Jonathan Gratch, Emilio Ferrara, Jonathan May

机构 * Department of Computer Science and Information Sciences Institute University of Southern California(计算机科学系和信息科学研究所 南加州大学)

AI总结 本文探讨了语言模型作为对话调解员的效果,发现其能提供具体公平的反馈,但难以提升用户尊重与合作水平。

Comments 9 pages, NAACL 2024 Main

Journal ref Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies

URL PDF HTML 收藏
2607.15281 2026-07-20 cs.AI 新提交

Causal-Audit: Explicit and Auditable Graph-based Reasoning via Target-Aware Causal Chain Construction

因果审计:通过目标感知因果链构建进行显式且可审计的基于图的推理

Su Lan, Xuefei Yin, Yanming Zhu, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

AI总结 针对无上下文干预问答,提出因果审计框架,通过目标感知因果图构建和路径级因果证据聚合机制,将因果推理结构化,实验证明该框架优于现有方法,能提供可解释且可审计的推理痕迹。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics 2026

URL PDF HTML 收藏
2607.15280 2026-07-20 cs.AI 新提交

GraphDx: A Cost-Aware Knowledge-Enhanced Multi-Agent Framework for Sequential Diagnosis

GraphDx:一种用于顺序诊断的成本感知知识增强多智能体框架

Shaoting Tan, Ning Liu, Yuntao Du, Shuyue Wei, Wu Shuai, Qian Li, Yanyu Xu, Wei Zhang, Lizhen Cui, Haitao Yuan

机构 * Shandong University(山东大学) Nankai University(南开大学) East China Normal University(华东师范大学) National Technological University(国立科技大学)

AI总结 研究针对顺序诊断中平衡诊断准确性与资源成本的问题,提出GraphDx框架。该框架通过构建特殊知识图谱及引入协作智能体实现创新,实验表明其能显著提高诊断成功率并降低测试成本,为自动临床诊断提供有效方案。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 21721-21736, 2026

URL PDF HTML 收藏
2508.15396 2026-07-20 cs.CL

Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models

归因、引用与引述:基于大语言模型的证据导向文本生成综述

Tobias Schreieder, Tim Schopf, Michael Färber

机构 * TU Dresden & ScaDS.AI Dresden/Leipzig(德累斯顿技术大学及ScaDS.AI德累斯顿/莱比锡)

AI总结 本文综述了基于大语言模型的证据导向文本生成,分析了134篇论文,提出统一的分类体系,探讨了引用、归因和引述三种方法,并指出未来研究方向和挑战。

Comments Accepted at ACL 2026

URL PDF HTML 收藏
2509.18127 2026-07-20 cs.LG cs.AI cs.CL

Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework

Safe-SAIL: 通过稀疏自编码解释框架构建大语言模型的细粒度安全景观

Jiaqi Weng, Han Zheng, Hanyu Zhang, Ej Zhou, Qinqin He, Jialing Tao, Hui Xue, Zhixuan Chu, Xiting Wang

机构 * Alibaba Group(阿里巴巴集团) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Renmin University of China(中国人民大学)

AI总结 本文提出Safe-SAIL框架,通过稀疏自编码解释方法高效识别安全领域特征,减少解释成本55%,并系统评估1758个安全相关特征,揭示风险特征识别和安全关键实体编码机制。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18916-18935 (2026)

URL PDF HTML 收藏
2602.13836 2026-07-20 cs.CL 版本更新

Speculative Decoding with a Speculative Vocabulary

基于推测词汇的推测解码

Miles Williams, Young D. Kwon, Rui Li, Alexandros Kouris, Stylianos I. Venieris

机构 * University of Sheffield(谢菲尔德大学) Samsung AI Center(三星人工智能中心)

AI总结 本文提出SpecVocab方法,通过动态选择词汇子集提升推测解码效率,实现比EAGLE-3更高的吞吐量。

Comments Findings of ACL 2026

URL PDF HTML 收藏
2601.13020 2026-07-20 cs.LG cs.AI 版本更新

PASs-MoE: Mitigating Misaligned Co-drift among Router and Experts via Pathway Activation Subspaces for Continual Learning

PASs-MoE:通过路径激活子空间减轻路由器与专家之间的错位协同漂移以进行持续学习

Zhiyan Hou, Haiyun Guo, Haokai Ma, Yandu Sun, Yonghui Yang, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Southeast University, Nanjing, China(南京东南大学) Wuhan AI Research, Wuhan, China(武汉人工智能研究院)

AI总结 研究持续指令调整中多模态大语言模型的问题,提出基于路径激活子空间的固定容量PASs - MoE - LoRA方法,含PAS引导的重新加权和PAS感知的秩稳定,实验表明该方法在准确性和抗遗忘性上优于基线和变体且不增参数。

Comments Published in the Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Volume 1: Long Papers. 14 pages. Code is available at https://github.com/yueluoshuangtian/PASs-MoE

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 31959--31972, San Diego, California, United States, July 2026. Association for Computational Linguistics

URL PDF HTML 收藏
2303.01421 2026-07-20 cs.CL cs.LG 版本更新

Learn to Memorize: Scalable Continual Learning in Semiparametric Models with Mixture-of-Neighbors Induction Memory

学习记忆:基于邻居混合归纳记忆的半参数模型中的可扩展持续学习

Guangyue Peng, Tao Ge, Wen Luo, Wei Li, Houfeng Wang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Microsoft(微软公司) Microsoft Research Asia(微软亚洲研究院)

AI总结 研究半参数语言模型中记忆缺乏学习能力的问题,提出将非参数记忆重新概念化为可学习的邻居混合归纳记忆(MoNIM),融入模型信息流,经实验验证其能提升半参数语言模型的可扩展性和持续学习性能。

Comments 15 pages, 5 figures

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 28517-28531, Vienna, Austria. Association for Computational Linguistics, 2025

URL PDF HTML 收藏
2605.27636 2026-07-17 cs.CL

Simorgh at SemEval-2026 task 7: Region-Aware Hybrid Retrieval for Low-Resource Cultural Reasoning in Multilingual Question Answering

Simorgh at SemEval-2026 task 7: 面向低资源文化推理的多语言问答中的区域感知混合检索

Hadi Bayrami Asl Tekanlou, Mahdi Bakhtiyarzadeh, Jafar Razmara

机构 * University of Tabriz(塔布里兹大学)

AI总结 提出区域感知混合检索方法,结合BM25和稠密语义相似度与区域加权启发式,以提升多语言文化问答的跨语言稳定性。

Comments 6 pages, 3 figures, accepted to the Everyday Knowledge Across Diverse Languages and Cultures shared task at SemEval2026

Journal ref Proceedings of the 20th International Workshop on Semantic Evaluation (SemEval-2026), Association for Computational Linguistics, 2026, pp. 624-629

URL PDF HTML 收藏
2503.19877 2026-07-17 cs.CL 版本更新

Scaling Evaluation-time Compute with Reasoning Models as Evaluators

通过推理模型作为评估器来提升评估时的计算能力

Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学) UIUC(伊利诺伊大学) KAIST AI(韩国科学技术院人工智能研究所) NEC Laboratories Europe(日本 NEC 欧洲实验室) Ss.Cyril and Methodius University of Skopje(斯科普里塞尔吉尔和梅蒂乌斯大学)

AI总结 本文探讨了通过增加评估时的计算量来提升语言模型的评估能力,利用推理模型作为评估器,分别评估响应整体和每个步骤,从而提高评估效果。

Comments ACL 2026 Findings

URL PDF HTML 收藏
2604.02668 2026-07-16 cs.CL cs.AI cs.MA 版本更新

Too Polite to Disagree: Understanding Sycophancy Propagation in Multi-Agent Systems

过于礼貌而不反驳:理解多智能体系统中的趋炎附势传播

Vira Kasprova, Amruta Parulekar, Abdulrahman AlRabah, Krishna Agaram, Ritwik Garg, Sagar Jha, Nimet Beyza Bozdag, Dilek Hakkani-Tur

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究探讨多智能体系统中趋炎附势行为的影响,通过实验发现提供趋炎附势先验信息可减少影响、缓解错误连锁反应并提升讨论准确性。

Journal ref Proceedings of the 27th Annual Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL 2026), pages 795-814, Association for Computational Linguistics

URL PDF HTML 收藏
2607.11893 2026-07-15 cs.CL cs.AI 新提交

I'm Sorry, but I Can't Help with Braille: Revealing Accessibility Failures in State-of-the-Art LLMs

对不起,我无法处理盲文:揭示当前最先进语言模型中的无障碍性缺陷

Abdullah Abdullah

机构 * orinu Inc.(奥里努公司)

AI总结 研究评估先进语言模型在韩语-盲文翻译上的表现,发现其存在缺陷。通过人工标注数据集测试,发现输出差且不稳定。对比发现,对小模型进行监督微调效果更好,揭示了当前语言模型的局限,证明特定监督的有效性。

Comments Accepted at the LTEDI Workshop at ACL 2026

URL PDF HTML 收藏
2606.06715 2026-07-15 cs.CL cs.AI cs.LG 版本更新

Does Topic Sentiment Cause Perceived Ideology? Comparing Human and LLM Annotations in Political News Articles

主题情感是否导致感知意识形态?比较政治新闻文章中人类与LLM的标注

Upasana Chatterjee

机构 * Columbia University(哥伦比亚大学)

AI总结 研究主题情感对感知政治意识形态的因果效应,通过比较人类与LLM标注,发现微调GPT-4o-mini产生显著因果效应,归因于捷径学习。

Comments V1 accepted to ACL SRW 2026. V2 updates experiments

URL PDF HTML 收藏
2511.09483 2026-07-15 cs.AI 版本更新

CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain?

CrochetBench:视觉语言模型能否在钩针领域从描述转向实践?

Peiyu Li, Xiaobao Huang, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺特大学)

AI总结 探讨视觉语言模型在钩针领域从描述到实践的转变,采用CrochetPARADE DSL进行评估,涵盖多种任务,发现评估转变时性能下降,揭示模型局限性,为评估多模态模型过程能力提供新视角。

Comments ACL2026 main-long

Journal ref Proceedings of ACL 2026, Vol. 1, pp. 13229-13251

URL PDF HTML 收藏
2601.17181 2026-07-15 cs.CL

Systematicity between Forms and Meanings across Languages Supports Efficient Communication

跨语言形式与意义之间的系统性支持高效沟通

Doreen Osmelak, Yang Xu, Michael Hahn, Kate McCurdy

机构 * Saarland University(萨尔兰大学) Department of Computer Science, Cognitive Science Program(计算机科学系、认知科学项目) University of Toronto(多伦多大学)

AI总结 本研究通过分析多语言中动词和代词的语法意义表达,提出基于可学习性的新复杂性度量,揭示了形式与意义之间的系统性关系,为高效沟通理论提供了新连接。

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (ACL 2026)

URL PDF HTML 收藏
2601.13525 2026-07-15 cs.IR 版本更新

More Than Efficiency: Embedding Compression Improves Domain Adaptation in Dense Retrieval

超越效率:嵌入压缩改善密集检索中的领域适应

Chunsheng Zuo, Daniel Khashabi

AI总结 针对密集检索中训练与目标领域分布不匹配的问题,提出对查询嵌入进行PCA压缩以保留领域相关特征并丢弃非判别成分,在9个检索器和14个MTEB数据集上验证了该方法能有效提升检索性能。

Comments Oral at SURGeLLM 2026 Workshop at ACL 2026

URL PDF HTML 收藏
2607.10787 2026-07-14 cs.CV cs.CL 新提交

Detecting AI-Generated Video: A Vision-Language Dual-View Survey

检测人工智能生成的视频:视觉-语言双视角综述

Dylan Xinming Hou, Juntian Zhang, Xu Gu, Yichen Wu, Nils Lukas, Gus Xia, Xiuying Chen, Yuhan Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) Harvard University(哈佛大学)

AI总结 综述人工智能生成视频检测,将任务重定义为事实保真度验证,提出视觉-语言双视角分类法,基于对221篇论文回顾,综合生成范式、审视检测方法、回顾评估指标,讨论挑战并指出未来方向。

Comments 51 pages, accepted by ACL 2026

Journal ref Association for Computational Linguistics 2026 pages 32221 to 32255

URL PDF HTML 收藏
2607.10715 2026-07-14 cs.CL cs.AI 新提交

A Corpus of Persuasion Techniques in Slavic Languages

斯拉夫语中的说服技巧语料库

Jakub Piskorski, Dimitar Iliyanov Dimitrov, Marina Ernst, Jacek Haneczok, Michał Marcińczuk, Arkadiusz Modzelewski, Roman Yangarber

机构 * Institute of Computer Science, Polish Academy of Science(波兰科学院计算机科学研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学圣克莱门特·奥赫里德斯基分校) University of Koblenz(科布伦茨大学) Visa Technology Europe(维萨欧洲技术公司) CodeNLP(代码自然语言处理公司) University of Padua(帕多瓦大学) University of Helsinki(赫尔辛基大学)

AI总结 本文聚焦斯拉夫语构建说服技巧语料库,涵盖三国语言、约7500个文本跨度及25种细粒度技巧。描述创建过程并统计,研究话题与技巧相关性,还用多种模型提供检测和分类的基线及基准结果。

Comments Corpus used for SlavicNLP 2025 Workshop co-located with ACL 2025, Published at LREC 2026

URL PDF HTML 收藏
2508.21787 2026-07-14 cs.CL cs.AI 版本更新

PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains

PiCSAR:基于推理链的概率置信度选择与排序

Joshua Ong Jun Leang, Zheng Zhao, Aryo Pradipta Gema, Sohee Yang, Wai-Chung Kwan, Xuanli He, Wenda Li, Pasquale Minervini, Eleonora Giunchiglia, Shay B. Cohen

机构 * Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院)

AI总结 PiCSAR通过联合对数似然度评估推理链和最终答案的置信度,无需训练即可提升大语言模型和推理模型的准确性,在多个基准测试中表现优异。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

URL PDF HTML 收藏