arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2025-12-16 至 2025-12-16 共收录 5
2512.12839 2025-12-16 cs.CL

What Matters in Evaluating Book-Length Stories? A Systematic Study of Long Story Evaluation

在评估长篇故事时什么重要?对长篇故事评估的系统研究

Dingyi Yang, Qin Jin

机构 * Renmin University of China(中国人民大学)

AI总结 本文提出LongStoryEval基准和NovelCritique模型,通过系统研究揭示长篇故事评估的关键因素和有效方法。

Comments 24 pages, 7 figures, Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19764 2025-12-16 cs.CL

Principled Personas: Defining and Measuring the Intended Effects of Persona Prompting on Task Performance

原则性人格:定义并衡量人格提示对任务表现的预期效果

Pedro Henrique Luz de Araujo, Paul Röttger, Dirk Hovy, Benjamin Roth

AI总结 本文研究了专家人格提示对任务表现的影响,发现其效果不一致,模型对无关属性敏感,提出缓解策略但仅对大模型有效,强调需更严谨的人格设计和评估方案。

Comments 30 pages, 29 figures, accepted to EMNLP 2025

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 26845-26874, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13405 2025-12-16 cs.CL

RealHiTBench: A Comprehensive Realistic Hierarchical Table Benchmark for Evaluating LLM-Based Table Analysis

RealHiTBench: 一个全面的现实感分层表格基准,用于评估基于LLM的表格分析

Pengzuo Wu, Yuhang Yang, Guangcheng Zhu, Chao Ye, Hong Gu, Xu Lu, Ruixuan Xiao, Bowen Bao, Yijing He, Liangyu Zha, Wentao Ye, Junbo Zhao, Haobo Wang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Institute of Computing Innovation, Zhejiang University(浙江大学计算机创新研究院)

AI总结 RealHiTBench是一个用于评估基于LLM的表格分析能力的综合现实感分层表格基准,通过多种输入格式和复杂结构的表格测试,验证了改进LLMs对表格层次结构感知的重要性。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16763 2025-12-16 cs.CV

Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation

自奖励的大型视觉-语言模型用于优化文本到图像生成中的提示

Hongji Yang, Yucheng Zhou, Wencheng Han, Jianbing Shen

机构 * University of Macau(澳门大学)

AI总结 本文提出了一种自奖励的大型视觉-语言模型框架,用于优化文本到图像生成中的提示,通过统一求解器和奖励模型实现自我改进,实验表明其优于其他方法。

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11998 2025-12-16 cs.CL

Direct Confidence Alignment: Aligning Verbalized Confidence with Internal Confidence In Large Language Models

直接置信对齐:将 verbalized 置信度与内部置信度对齐于大语言模型

Glenn Zhang, Treasure Mayowa, Jason Fan, Yicheng Fu, Aaron Sandoval, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

AI总结 本文提出直接置信对齐方法,通过优化使LLM的 verbalized 置信度与内部置信度对齐,提升模型透明度和可靠性。

Comments Accepted at ACL 2025 SRW, 5 pages body, 14 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏