arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-09-01 至 2026-09-01 共收录 229
2608.28496 2026-09-01 cs.CL 版本更新

Ladders in Chaos: When, How, (and Perhaps Why) Does Test-Time Scaling Improve LLM Machine Translation

混沌中的阶梯:测试时缩放何时、如何(或许还有为何)提升大语言模型的机器翻译性能

Di Wu, Sergey Troshin, Christof Monz, Antske Fokkens, Vlad Niculae

机构 * University of Amsterdam(阿姆斯特丹大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

AI总结 本研究探究LLM的序列式与并行式测试时缩放在机器翻译中的特性,发现序列式采样性能上限更高,可提升翻译流畅度但在大推理预算下会降准,还分析了其机制与鲁棒性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27505 2026-09-01 cs.CL cs.AI 版本更新

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27380 2026-09-01 cs.CL 版本更新

D2C-Routing: Dimension-to-Composition Evidence Routing for Mixed-Origin AI-Generated Text Detection

D2C-Routing:用于混合来源AI生成文本检测的维度到组成证据路由

Xin Chen, Fuwei Zhang, Yiqi Tong, Wei Guo, Yutian Xiao, Fuzhen Zhuang

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 本研究针对混合来源AI生成文本检测问题,提出D2C-Routing方法,在MixD2C数据集上取得0.8603的四向平均TPR@1%FPR,性能优于RACE-local重运行结果。

Comments 17 pages, 4 figures. To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27004 2026-09-01 cs.CV 版本更新

MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

MVC-Bench:医学视觉-语言模型的校准基准测试

Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir, Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)

AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26956 2026-09-01 cs.CV 版本更新

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26638 2026-09-01 cs.CL stat.ML 版本更新

Which Metrics Save the Most Human Annotation? Prediction-Powered Evaluation and Meta-Evaluation

哪些指标能节省最多的人工标注?预测驱动的评估与元评估

Mingqi Gao, Anthony Sicilia, Weiyan Shi

机构 * Northeastern University(东北大学) West Virginia University(西弗吉尼亚大学)

AI总结 该研究基于预测驱动推理提出预测驱动评估框架,引入预测驱动节省率元指标,结合有限人工判断与大规模自动评分实现无偏高效的系统比较,可节省人工标注成本,适用于各类无法验证的任务。

Comments Accepted at EMNLP 2026 (Main). Code available: https://github.com/CHATS-lab/ppi-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26576 2026-09-01 cs.CL 版本更新

Double Trouble: Bilingual Pretraining Leaves Language-Conditioned Effects in Shared-Language Representations

双重麻烦:双语预训练会在共享语言表征中留下语言条件效应

Anjishnu Mukherjee, Ziwei Zhu, Antonios Anastasopoulos

机构 * George Mason University(乔治梅森大学)

AI总结 该研究发现仅解码器多语言模型中,双语预训练会使共享语言的深层隐藏状态表征存在差异,嵌入对齐无法掩盖该差异,这对依赖对齐模型的下游研究有重要影响。

Comments Published as a conference paper at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25992 2026-09-01 cs.AI cs.MA 版本更新

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排

Songyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang

机构 * Aston University(阿斯顿大学) Queen Mary University of London(伦敦玛丽女王大学) University of Exeter(埃克塞特大学)

AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。

Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25343 2026-09-01 cs.CL 版本更新

GUIDE: Generative Unsupervised Chinese Query Correction via Phonetic and Visual Shared-ID Encoding

GUIDE:基于语音与视觉共享ID编码的生成式无监督中文查询纠错方法

Lei Yang, Binbin Huang, Jiwei Tan, Xuhui Sui, Chang Tu, Yi Wang, Han Li

机构 * Kuaishou Technology(快手科技) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 本文针对中文查询纠错中监督方法维护成本高、无监督方法易意图偏移的问题,提出基于语音与视觉共享ID编码的生成式无监督框架GUIDE,在公开与真实数据集上均优于基线,线上测试也验证了其有效性。

Comments Accepted to EMNLP 2026 Industry Track; 7 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25200 2026-09-01 cs.LG cs.AI cs.CL 版本更新

MoPLEx: Estimating Plackett-Luce Mixture Models for Multi-Objective Alignment

学习用于多目标对齐的Plackett-Luce模型混合

Dongyue Li, Ziniu Zhang, Lu Wang, Hongyang R. Zhang

机构 * Northeastern University(东北大学) University of Michigan(密歇根大学)

AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。

Comments 19 pages; To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25089 2026-09-01 cs.CL 版本更新

Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

公平可比?面向可比较的跨语言语言模型评估

Xiulin Yang, Ethan Gotlieb Wilcox, Catherine Arnett

机构 * Georgetown University(乔治城大学) EleutherAI

AI总结 该研究针对跨语言语言模型评估的可比性挑战,通过受控单语言模型和多语言LLM验证,发现常用归一化指标存在跨语言偏差,提出语义等价序列的句子级负对数似然更适合跨语言比较。

Comments EMNLP 2026 CR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24945 2026-09-01 cs.LG cs.AI cs.DC 版本更新

FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

FAMPWQ:基于费舍尔信息的自适应混合精度权重量化方法,用于高效的大语言模型推理

Gongwei Lee, Ji Liu, Juncheng Jia, Ji Wu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Hithink Research(海思睿研究中心) Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 针对LLM部署的资源瓶颈,该研究提出FAMPWQ方法,通过费舍尔信息度量层敏感度结合强化学习分配位宽,在7个模型和5个基准上优于7种基线方法,提升了量化性能。

Comments 21 pages, to appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24080 2026-09-01 cs.CL cs.AI 版本更新

When Less Is More: An Empirical Study of Minimal Responses in Counseling Dialogues and the Behavior of LLMs

少即是多:心理咨询对话中极简回应与大语言模型(LLM)行为的实证研究

Zhiyang Qi

机构 * The University of Tokyo(东京大学)

AI总结 本文通过实证研究发现,心理咨询对话中常见的极简回应在LLM生成内容中占比极低,商业LLM可按指令生成此类回应但难判断适用时机,专用模型表现差且基于LLM的评估易低估其价值。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23978 2026-09-01 cs.AI cs.CV 版本更新

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

当视觉不再足够:评估大视觉语言模型(LVLMs)中的交互式视觉定位

Zhengxiang Wang, Owen Rambow

机构 * Stony Brook University(石溪大学)

AI总结 本文针对大视觉语言模型(LVLMs)提出交互式视觉定位的受控评估框架,发现当前LVLMs表现低于人类基线,主动提问式定位困难且校准不佳,该任务仍具挑战性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23152 2026-09-01 cs.CL 版本更新

Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation

结合证据的回应!用于仇恨类别感知反仇恨言论生成的多智能体内存高效推理框架

Sujoy Nath, Aswini Kumar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院)

AI总结 该研究针对现有反仇恨言论生成未区分仇恨言论类别的问题,提出多智能体框架FIRE并构建数据集FactualCS,实验显示FIRE效果优于基线且毒性更低。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23124 2026-09-01 cs.CL cs.AI 版本更新

LITERARYBIGFIVE: Author-Personalized Text Generation in a Unified Interpretable Space

LITERARYBIGFIVE:统一可解释空间中的作者个性化文本生成

Jinghui Zhang, Lang Gao, Ao Li, Mingzhe Li, Ruihong Zeng, Zirui Song, Kentaro Inui, Xiuying Chen

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Shandong University(山东大学) ByteDance(字节跳动) Tohoku University(东北大学) RIKEN(理化学研究所)

AI总结 针对现有作者个性化文本生成方法成本高、难解释、泛化差的问题,提出LiteraryBigFive框架,将作者写作特征映射到统一可解释空间,结合可解释引导机制实现个性化生成,提升表达力且符合文学共识。

Comments EMNLP 2026 Findings, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22704 2026-09-01 cs.CL cs.SD 版本更新

WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs

WnW:用于长文本语音大语言模型的消长型键值缓存

Yiming Yao, Chenyang Lyu, Xuanfan Ni, Longyue Wang, Weihua Luo, Yazheng Yang, Jinsong Su

机构 * Alibaba Group(阿里巴巴集团) School of Informatics Xiamen University(厦门大学信息学院)

AI总结 针对长音频语音大语言模型的KV缓存内存开销问题,提出WnW消长型KV缓存方法,通过分类KV头实现高准确率与低GPU内存占用,且开销小、可迁移。

Comments Accepted at EMNLP 2026 Main Conference. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22559 2026-09-01 cs.AI cs.CL cs.IR 版本更新

ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation

ExecRubrics:用于可验证且高效的长文本评估的可执行工具增强型评分标准

Kaustubh D. Dhole, Charles L. A. Clarke, Eugene Y. Agichtein

机构 * Emory University(埃默里大学) University of Waterloo(滑铁卢大学)

AI总结 ExecRubrics是将评分标准转化为可执行Python程序的框架,可替代黑盒LLM评判者,在三个长文本基准上实现与自然语言评分标准相当或更优的偏好准确率,且评估延迟降低最多320倍,提升了评估的可解释性与效率。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22479 2026-09-01 cs.CL cs.LG 版本更新

GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning

GTA-RAG:用于多轮检索增强推理的图轨迹增强强化学习

Jun Chen, Yongchao Liu, Pengyu Qiu, Jiajun Zheng, Juelu Zhang, Yujie Zeng, Qin Zhang, Ziyue Qiao, Xiao Luo

机构 * Shenzhen University(深圳大学) Great Bay University(大湾区大学) Ant Group(蚂蚁集团)

AI总结 GTA-RAG是一种图轨迹增强强化学习框架,通过轨迹级监督优化检索策略,在多跳和简单问答基准上,相比RL-based RAG基线提升了性能与证据链覆盖率。

Comments 12 pages, 5 figures. Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22370 2026-09-01 cs.CV 版本更新

LiST: Local-Simplex Test-Time LoRA Fusion

LiST:局部单纯形测试时LoRA融合

Yihua Shao, Jia Li, Siyu Chen, Xinyu Luo, Yang Liu, Kecheng Chen, Xinwei Long, Lingyu Zhu, Fanhu Zeng, Maolin Wang, Ziyang Yan, Jingcai Guo, Hao Tang, Nicu Sebe, Zhenyi Wang

机构 * SUSTech(南方科技大学) PolyU(香港理工大学) CASIA(中国科学院自动化研究所) GDUT(广东工业大学) CityU(香港城市大学) BigAI(北京智源人工智能研究院) THU(清华大学) TAU(特拉维夫大学) PKU(北京大学) UniTrento(特伦托大学)

AI总结 LiST是一种无标签测试时LoRA融合框架,通过构建局部单纯形搜索样本特定融合权重,在多模态与语言基准上优于静态LoRA合并及传统测试时自适应方法,提升了未见过任务的鲁棒性。

Comments Accepted by EMNLP 2026 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22130 2026-09-01 cs.MA cs.CL 版本更新

PropUQ-MAS: Propagation-Aware Uncertainty Quantification for LLM Multi-Agent Systems

PropUQ-MAS:面向大语言模型多智能体系统的传播感知不确定性量化

Yaokun Liu, Yifan Liu, Daniel Yue Zhang, Ruichen Yao, Zelin Li, Dong Wang

机构 * Scale AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对现有不确定性量化方法无法捕捉大语言模型多智能体系统中不确定性传播的问题,提出PropUQ-MAS框架,实验显示其可显著提升该系统的不确定性量化性能。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15071 2026-09-01 cs.AI cs.CL 版本更新

Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents

Evo-Harness:面向自进化智能体的上下文到 harness 的技能编译

Tianxin Wei, Zhan Shi, Minhua Lin, Bing He, Zewen Liu, Yisi Sang, Yuanchen Bei, Xuying Ning, Jiaru Zou, Ting-Wei Li, Xiao Lin, Yanjun Zhao, Chi Wang, Benoit Dumoulin, Dakuo Wang, Jingrui He, Hanqing Lu

AI总结 针对现有自进化 LLM 智能体方法的不足,提出 Evo-Harness 框架,通过上下文到 harness 的技能编译提炼单次执行的噪声上下文,在五个现实基准上验证了其有效性,为 LLM 智能体即时学习提供了原则性理解。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11847 2026-09-01 cs.CV cs.AI cs.CL 版本更新

LookBack: Where and How to Score LVLM Responses via Visual Reference Usage

LookBack:通过视觉参考使用情况对LVLM响应进行评分的位置与方法

Beomsik Cho, Jinhyeong Kim, Dongseok Lee, Jaehyung Kim

机构 * Yonsei University(延世大学)

AI总结 针对LVLM响应存在的图像相关幻觉问题,提出无需训练的LookBack评分方法,结合视觉回溯评分增强token似然,在四个基准和三个模型上提升了Best-of-$N$选择性能且开销极小。

Comments Findings of EMNLP 2026. 24 pages, 12 figures. Code: https://github.com/bscho333/LookBack

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10810 2026-09-01 cs.CL cs.AI 版本更新

Surfacing the Unsaid: CUE-Bench for Affective Stance in Chinese Discourse

揭示未明之言:面向中文话语情感立场的CUE-Bench基准

Zhenyan Zheng, Yunyao Zhang, Junxi Sheng, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有情感基准缺乏情感相关要素结构化说明的问题,本文构建了以情感立场为核心的CUE Bench基准,实验证实融入情感立场可提升细粒度情感识别与语用意图检测性能。

Journal ref EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03437 2026-09-01 cs.CL cs.LG 版本更新

Dynamically Allocating Evaluation Effort for Model Ranking

为模型排名动态分配评估工作量

Vilém Zouhar, Julia Kreutzer, Alon Lavie, Tom Kocmi, Matt Post, Ondřej Bojar, Mrinmaya Sachan

AI总结 针对NLP模型人工评估成本高、效率低的问题,将其形式化为多臂老虎机最佳臂识别问题,提出自适应采样算法,可优化预算分配,提升评估效率与模型区分度。

Comments EMNLP 2026; typeset with Typst

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03044 2026-09-01 cs.CL cs.AI 版本更新

Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation

模拟还是估计?基础语言模型与后训练语言模型在观点模拟中的差异化优势

Seth Grief-Albert, Jessica Bo, Difan Jiao, Ashton Anderson

AI总结 该研究针对大型语言模型用于观点模拟的矛盾结果,区分了模拟与估计任务,发现基础模型更适合模拟、后训练模型更适合估计,为相关模型选择提供了依据。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01460 2026-09-01 cs.LG 版本更新

Conformalized Large Language Models under Configuration Shift

配置偏移下的共形大语言模型

Yuqicheng Zhu, Jialin Yu, Lin Li, Gengyuan Zhang, Zhen Yang, Steffen Staab, Puneet Dokania, Philip Torr, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Robert Bosch GmbH(罗伯特·博世有限公司) University of Oxford(牛津大学) LMU Munich(慕尼黑大学) Tsinghua University(清华大学) University of Southampton(南安普顿大学) University of Oslo(奥斯陆大学)

AI总结 该研究针对配置偏移对共形大语言模型有效性的影响展开系统分析,通过多维度实证研究揭示其削弱覆盖率的问题,提出两种实用缓解措施以恢复覆盖率并保留效率。

Comments Accepted to EMNLP 2026 as a main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01291 2026-09-01 cs.CL 版本更新

ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification

ArabicDialectSafety:一种面向阿拉伯语内容安全分类的方言感知基准

Wajdi Zaghouani, Md. Rafiul Biswas, Kholoud Khalil Aldous, Mabrouka Bessghaier

机构 * Northwestern University in Qatar(卡塔尔西北大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

AI总结 本研究构建了覆盖6种阿拉伯语变体的安全基准数据集,提出双任务评估框架,发现微调后的MARBERTv2性能最优,低资源马格里布方言仍存差距,前沿大语言模型不安全生成率低于5%。

Comments 13 pages, 2 figures, 9 tables

Journal ref EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01017 2026-09-01 cs.CL cs.AI 版本更新

Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy

大模型为何妥协:医学谄媚背后的对话因素与推理

Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho

机构 * Virginia Tech(弗吉尼亚理工大学) Shanghai Tongren Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属同仁医院) Emory University(埃默里大学)

AI总结 研究发现医学谄媚是对话属性而非模型属性,通过5个开放权重模型和500个MedQuAD问题的120万次试验,揭示了对话因素对医学谄媚的影响及思维链轨迹的解释。

Comments 22 pages, 8 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28648 2026-09-01 cs.HC cs.AI cs.CL 版本更新

Why It Hurts: Identifying the Drivers of Negative Thoughts in Emotional Support Conversations

为何会痛苦:识别情感支持对话中消极想法的驱动因素

Hainiu Xu, Zhaoyue Sun, Hanqi Yan, Jinhua Du, Caroline Catmur, Yulan He

机构 * King’s College London(伦敦国王学院) JinFlow Intelligence Ltd.(金流智能公司) The Alan Turing Institute(阿兰·图灵研究所)

AI总结 本研究针对LLM情感支持任务中认知评估维度显著性被忽视的问题,推出AppraiSal基准并提出基于贝叶斯逆规划的多智能体概率框架PRISM,提升了LLMs识别情境特定显著评估维度的能力。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏