arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2025-12-12 至 2025-12-12 共收录 4
2505.22888 2025-12-12 cs.CL

When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy

当模型用你的语言思考:控制思考语言会以准确性为代价

Jirui Qi, Shan Chen, Zidi Xiong, Raquel Fernández, Danielle S. Bitterman, Arianna Bisazza

机构 * University of Groningen(格罗宁根大学) Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) University of Amsterdam(阿姆斯特丹大学)

AI总结 研究发现,强制模型用用户语言推理虽提高可读性但降低准确性,通过微调可缓解此矛盾,揭示当前大型推理模型在多语言推理上的局限性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08694 2025-12-12 cs.CL

TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planning

TP-RAG:用于时空感知旅行规划的检索增强型大语言模型代理基准测试

Hang Ni, Fan Liu, Xinyu Ma, Lixin Su, Shuaiqiang Wang, Dawei Yin, Hui Xiong, Hao Liu

AI总结 TP-RAG提出了一种用于时空感知旅行规划的检索增强型大语言模型基准测试,通过整合参考轨迹提升旅行计划的空间效率和兴趣点合理性,采用EvoRAG框架实现更高效的时空合规性。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00597 2025-12-12 cs.CL cs.AI

On the Consistency of Multilingual Context Utilization in Retrieval-Augmented Generation

在检索增强生成中多语言上下文利用的一致性

Jirui Qi, Raquel Fernández, Arianna Bisazza

机构 * Center for Language and Cognition (CLCG), University of Groningen(格罗宁根大学语言与认知中心) Institute for Logic, Language and Computation (ILLC), University of Amsterdam(阿姆斯特丹大学逻辑、语言与计算研究所)

AI总结 研究探讨LLMs在多语言RAG中利用不同语言上下文的一致性,发现其能提取异语言信息但难以生成正确语言答案。

Comments Best Paper Award at MRL Workshop 2025, colocated with EMNLP 2025. All codes and data are released at https://github.com/Betswish/mRAG-Context-Consistency

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19999 2025-12-12 cs.CL

The SIFo Benchmark: Investigating the Sequential Instruction Following Ability of Large Language Models

SIFo基准:研究大型语言模型的顺序指令遵循能力

Xinyi Chen, Baohao Liao, Jirui Qi, Panagiotis Eustratiadis, Christof Monz, Arianna Bisazza, Maarten de Rijke

机构 * University of Amsterdam(阿姆斯特丹大学) University of Groningen(格罗宁根大学)

AI总结 SIFo基准通过四个任务评估大型语言模型在多指令遵循中的能力,发现较新和更大的模型在任务表现上更优,揭示了当前语言模型在指令序列处理上的鲁棒性不足。

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏