arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-22 至 2026-01-22 共收录 182 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 32 篇

2601.14352 2026-01-22 cs.RO 50%

RoboBrain 2.5: Depth in Sight, Time in Mind

RoboBrain 2.5:视觉深度,思维时间

Huajie Tan, Enshen Zhou, Zhiyu Li, Yijie Xu, Yuheng Ji, Xiansheng Chen, Cheng Chi, Pengwei Wang, Huizhu Jia, Yulong Ao, Mingyu Cao, Sixiang Chen, Zhe Li, Mengzhen Liu, Zixiao Wang, Shanyu Rong, Yaoxu Lyu, Zhongxia Zhao, Peterson Co, Yibo Li, Yi Han, Shaoxuan Xie, Guocai Yao, Songjing Wang, Leiduo Zhang, Xi Yang, Yance Jiao, Donghai Shi, Kunchang Xie, Shaokai Nie, Chunlei Men, Yonghua Lin, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * BAAI RoboBrain Team(百度人工智能研究院RoboBrain团队)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 RoboBrain 2.5通过提升3D空间推理和时间值估计,增强具身智能在复杂精细操作中的物理基础和执行感知能力。

Comments 37 pages, 13 figures, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 46 篇

2601.15267 2026-01-22 cs.CY cs.AI cs.CL 90%

Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions

评估大型语言模型在法律应用中的表现:挑战、方法与未来方向

Yiran Hu, Huanghai Liu, Chong Wang, Kunran Li, Tien-Hsuan Wu, Haitao Li, Xinran Xu, Siqing Huo, Weihang Su, Ning Zheng, Siyuan Zheng, Qingyao Ai, Yun Liu, Renjun Bian, Yiqun Liu, Charles L. A. Clarke, Weixing Shen, Ben Kao

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Waterloo(多伦多大学) Shanghai Jiaotong University(上海交通大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大型语言模型在法律应用中的评估挑战与方法,分析了现有评估框架的局限性,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15129 2026-01-22 cs.CL 89%

RSNA Large Language Model Benchmark Dataset for Chest Radiographs of Cardiothoracic Disease: Radiologist Evaluation and Validation Enhanced by AI Labels (REVEAL-CXR)

用于心胸疾病胸部X光影像的RSNA大语言模型基准数据集:通过AI标签增强的放射科评估和验证(REVEAL-CXR)

Yishu Wei, Adam E. Flanders, Errol Colak, John Mongan, Luciano M Prevedello, Po-Hao Chen, Henrique Min Ho Lee, Gilberto Szarf, Hamilton Shoji, Jason Sho, Katherine Andriole, Tessa Cook, Lisa C. Adams, Linda C. Chu, Maggie Chung, Geraldine Brusca-Augello, Djeven P. Deva, Navneet Singh, Felipe Sanchez Tijmes, Jeffrey B. Alpert, Elsie T. Nguyen, Drew A. Torigian, Kate Hanneman, Lauren K Groner, Alexander Phan, Ali Islam, Matias F. Callejas, Gustavo Borges da Silva Teles, Faisal Jamal, Maryam Vazirabad, Ali Tejani, Hari Trivedi, Paulo Kuriki, Rajesh Bhayana, Elana T. Benishay, Yi Lin, Yifan Peng, George Shih

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究通过AI辅助标注流程,创建了包含200张胸部影像的基准数据集,用于评估不同模型,同时帮助放射科医生更高效地标注影像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15034 2026-01-22 cs.HC cs.AI 89%

Visual and Cognitive Demands of a Large Language Model-Powered In-vehicle Conversational Agent

基于大型语言模型的车载对话代理的视觉与认知需求

Chris Monk, Allegra Ayala, Christine S. P. Yu, Gregory M. Fitch, Dara Gruber

机构 * Exponent, Inc.(Exponent公司) Google, Inc.(Google公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究评估了基于大型语言模型的车载对话代理在驾驶中的视觉与认知需求,发现其与免提通话在认知负荷上相当,且视觉需求较低,支持其在驾驶环境中的安全应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14826 2026-01-22 cs.CL 89%

Comparative Study of Large Language Models on Chinese Film Script Continuation: An Empirical Analysis Based on GPT-5.2 and Qwen-Max

大型语言模型在中文电影剧本延续中的比较研究:基于GPT-5.2和Qwen-Max的实证分析

Yuxuan Cao, Zida Yang, Ye Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究比较GPT-5.2和Qwen-Max在中文电影剧本延续任务中的表现,发现GPT-5.2在结构保持和整体质量上显著优于Qwen-Max,为LLM在中文创意写作中的评估提供了实证框架。

Comments 18 pages, 6 figures, 6 tables, 20 references. First two authors contributed equally. Corresponding author: Ye Wang (wangye@whu.edu.cn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14446 2026-01-22 cs.CE cs.AI 89%

Diffusion Large Language Models for Black-Box Optimization

扩散大语言模型用于黑盒优化

Ye Yuan, Can, Chen, Zipeng Sun, Dinghuai Zhang, Christopher Pal, Xue Liu

机构 * McGill(麦吉尔大学) MILA - Quebec AI Institute(魁北克人工智能研究所) Microsoft Research(微软研究院) Polytechnique Montreal(蒙特利尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出dLLM,利用扩散LLMs的双向建模能力,结合遮蔽扩散树搜索,实现高效离线黑盒优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15277 2026-01-22 cs.CL 88%

Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks

利用大语言模型在对抗性情感攻击下的鲁棒虚假新闻检测

Sahar Tahmasebi, Eric Müller-Budack, Ralph Ewerth

机构 * TIB – Leibniz Information Centre for Science TIB -- Leibniz Information Centre for Science Marburg University \& Hessian Center for Artificial Intelligence (hessian.AI) Marburg/Darmstadt \ TIB \& L3S Research Center Hannover Germany

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出AdSent框架,通过可控情感对抗攻击和情感无关训练策略,提升虚假新闻检测在对抗性情感攻击下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15188 2026-01-22 cs.SE cs.AI cs.PL 88%

Benchmarking Large Language Models for ABAP Code Generation: An Empirical Study on Iterative Improvement by Compiler Feedback

对大型语言模型在ABAP代码生成中的性能评估:一项通过编译器反馈实现迭代改进的实证研究

Stephan Wallraven, Tim Köhne, Hartmut Westenberger, Andreas Moser

机构 * Technische Hochschule Köln(科隆技术大学) CONSILIO GmbH(CONSILIO公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究通过实证分析评估了大型语言模型在生成ABAP代码中的性能,探讨了编译器反馈对迭代改进的影响,并揭示了不同模型在任务类型上的表现差异。

Comments 20 pages, 10 figures, Author: Hartmut Westenberger (ORCID: 0009-0009-9063-8318)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14261 2026-01-22 cs.CV cs.HC cs.LG 88%

Intelligent Power Grid Design Review via Active Perception-Enabled Multimodal Large Language Models

通过主动感知多模态大语言模型实现智能电网设计审查

Taoliang Tan, Chengwei Ma, Zhen Tian, Zhao Lin, Dongdong Li, Si Shi

机构 * Yangjiang Yangxi Power Supply Bureau, Guangdong Power Grid Co., Ltd., Yangjiang, China(阳江阳西供电局,广东电网公司) Guangdong Laboratory of Artificial Intelligence(广东人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出基于主动感知多模态大语言模型的智能电网设计审查方法,通过三阶段框架提升对设计错误的识别准确性和审查可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12264 2026-01-22 cs.CL 88%

Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics

市场-基准:评估大型语言模型在初级量化交易和市场动态中的表现

Abhay Srivastava, Sam Jung, Spencer Mateega

机构 * AfterQuery

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MARKET-BENCH评估大型语言模型在初级量化交易任务中的表现,发现其在构建可执行回测程序方面有基本能力,但对价格、库存和风险的推理仍存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01129 2026-01-22 cs.SE cs.AI cs.CL cs.LG 87%

RovoDev Code Reviewer: A Large-Scale Online Evaluation of LLM-based Code Review Automation at Atlassian

RovoDev Code Reviewer: 一个大规模在线评估Atlassian中基于LLM的代码审查自动化工具

Kla Tantithamthavorn, Yaotian Zou, Andy Wong, Michael Gupta, Zhe Wang, Mike Buller, Ryan Jiang, Matthew Watson, Minwoo Jeong, Kun Chen, Ming Wu

机构 * Monash University \& Atlassian Australia. Monash University \& Atlassian

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RovoDev Code Reviewer通过大规模评估展示了基于LLM的代码审查自动化在提升效率和质量方面的效果

Comments Accepted at the 48th International Conference on Software Engineering (ICSE'26), SEIP Track. 12 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06605 2026-01-22 cs.CR cs.AI cs.CL 86%

Reading Between the Lines: Towards Reliable Black-box LLM Fingerprinting via Zeroth-order Gradient Estimation

在行之间阅读:通过零阶梯度估计实现可靠的黑盒LLM指纹识别

Shuo Shao, Yiming Li, Hongwei Yao, Yifei Chen, Yuchen Yang, Zhan Qin

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ZeroPrint方法,通过零阶梯度估计在黑盒环境下实现更可靠的LLM指纹识别,有效提升指纹识别的准确性和鲁棒性。

Comments This paper is accepeted by the ACM Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17825 2026-01-22 cs.AI 85%

FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs

FAIRGAMER:评估基于LLM的视频游戏NPC中的社会偏见

Bingkang Shi, Jen-tse Huang, Long Luo, Tianyu Zong, Hongzhu Yi, Yuanxiang Wang, Songlin Hu, Xiaodan Zhang, Zhongjiang Yao

机构 * School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Johns Hopkins University(约翰霍普金斯大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FAIRGAMER通过评估三种交互模式中的社会偏见,揭示了基于LLM的视频游戏NPC在决策上的偏见问题,并指出更大模型可能加剧这些偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00971 2026-01-22 cs.SE cs.AI 85%

Beyond Functional Correctness: Exploring Hallucinations in LLM-Generated Code

超越功能正确性:探索LLM生成代码中的幻觉

Fang Liu, Yang Liu, Lin Shi, Zhen Yang, Li Zhang, Xiaoli Lian, Zhongqi Li, Yuchi Ma

机构 * 2 State Key Laboratory of Complex \& Critical Software Environment (SKLCCSE) School of Computer Science Engineering, Beihang University, Beijing, China 3 School of Software, Beihang University, Beijing, China 4 School of Computer Science Technology, Shandong University, Qingdao, China 5 Huawei Cloud Computing Technologies Co., Ltd, China

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了LLM生成代码中的幻觉问题,通过分类和分析建立全面的幻觉分类体系,并提出轻量级的幻觉缓解方法。

Comments Accepted by Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14606 2026-01-22 cs.CR 85%

An LLM Agent-based Framework for Whaling Countermeasures

基于LLM代理的鲸鱼攻击防御框架

Daisuke Miyamoto, Takuji Iimura, Narushige Michishita

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出基于LLM代理的鲸鱼攻击防御框架,通过构建个性化防御资料和分析电子邮件,提升对高权威目标的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14266 2026-01-22 cs.LG cs.CL cs.CR 84%

GCG Attack On A Diffusion LLM

对扩散语言模型的GCG攻击

Ruben Neyroud, Sam Corley

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了GCG攻击对扩散语言模型LLaDA的影响,评估了多种攻击变体并探讨了模型的鲁棒性及对抗分析策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14479 2026-01-22 cs.CL 83%

Can LLM Reasoning Be Trusted? A Comparative Study: Using Human Benchmarking on Statistical Tasks

大语言模型的推理能力是否可信?:通过统计任务的人类基准测试

Crish Nagarkar, Leonid Bogachev, Serge Sharoff

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过统计任务的人类基准测试,评估了大语言模型在统计推理和自我评估能力上的表现,发现微调后的模型在统计任务上表现优异,且能更有效地评估答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24565 2026-01-22 cs.AI 83%

MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use

MCPAgentBench: 一个用于评估LLM代理MCP工具使用的现实任务基准

Wenrui Liu, Zixiang Liu, Elsie Dai, Wenhan Yu, Lei Yu, Tong Yang, Jinjun Han, Hong Gao

机构 * Peking University(北京大学) ZTE(中兴通讯)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCPAgentBench通过现实任务和动态沙盒环境评估LLM代理在复杂工具调用中的能力差异,提供开源代码以促进工具使用能力研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14728 2026-01-22 eess.AS cs.AI cs.CL cs.LG cs.SD 80%

AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering

AQAScore: 通过音频问答评估文本到音频生成中的语义对齐

Chun-Yi Kuan, Kai-Wei Chang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AQAScore通过音频问答评估文本到音频生成的语义对齐,利用大型语言模型的推理能力,有效捕捉语义不一致性。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14683 2026-01-22 cs.AI 79%

Local Language Models for Context-Aware Adaptive Anonymization of Sensitive Text

局部语言模型用于上下文感知的敏感文本自适应匿名化

Aisvarya Adeseye, Jouni Isoaho, Seppo Virtanen, Mohammad Tahir

机构 * Department of Computing, University of Turku(计算机系,图尔库大学)

专题命中 评测与基准 :language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出利用局部语言模型构建上下文感知的敏感文本自适应匿名化框架,通过四种策略有效识别并处理敏感信息,实验表明Phi模型在敏感数据识别和情感保留方面表现优异。

Comments Accepted and Waiting to be Published. ICAI'25: 27th International Conference on Artificial Intelligence https://american-cse.org/csce2025/conferences-ICAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19094 2026-01-22 cs.CL cs.AI cs.IR 79%

Pathways of Thoughts: Multi-Directional Thinking for Long-form Personalized Question Answering

思维路径:多方向思考用于长文本个性化问答

Alireza Salemi, Cheng Li, Mingyang Zhang, Qiaozhu Mei, Zhuowan Li, Spurthi Amba Hombaiah, Weize Kong, Tao Chen, Hamed Zamani, Michael Bendersky

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Google DeepMind(谷歌DeepMind) University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PoT方法,通过多方向思考生成个性化问答响应,实验证明其在长文本问答任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14744 2026-01-22 cs.SD eess.AS 78%

Unlocking Large Audio-Language Models for Interactive Language Learning

解锁大型音频-语言模型以实现交互式语言学习

Hongfu Liu, Zhouying Cui, Xiangming Gu, Ye Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出通过指令微调ALMs,利用L2-Arctic-plus数据集提升交互式语言学习中的发音训练效果。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11150 2026-01-22 stat.ME stat.AP stat.ML 78%

Causal Judge Evaluation: Calibrated Surrogate Metrics for LLM Systems

因果裁判评估:用于LLM系统的校准代理度量

Eddie Landesberg, Manjari Narayan

专题命中 评测与基准 :LLM(title,abstract)

AI总结 CJE通过校准廉价代理评分与小规模oracle切片,实现对LLM系统排名准确性的高效评估,显著提升验证效果与可靠性。

Comments Code: https://github.com/cimo-labs/cje Experiments for Reproducibility: https://github.com/cimo-labs/cje-arena-experiments Original Preprint: https://zenodo.org/records/17903629

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14679 2026-01-22 cs.MM cs.AI 77%

HCVR Scene Generation: High Compatibility Virtual Reality Environment Generation for Extended Redirected Walking

HCVR场景生成:为扩展定向行走设计的高兼容性虚拟现实环境生成

Yiran Zhang, Xingpeng Sun, Aniket Bera

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HCVR通过优化虚拟场景与物理空间的兼容性,显著减少虚拟现实中的物理碰撞,提升扩展定向行走的沉浸体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03149 2026-01-22 cs.LG 77%

PersonaLedger: Generating Realistic Financial Transactions with Persona Conditioned LLMs and Rule Grounded Feedback

PersonaLedger: 通过基于人设的LLM和规则驱动的反馈生成逼真的财务交易

Dehao Yuan, Tyler Farnan, Stefan Tesliuc, Doron L Bergman, Yulun Wu, Xiaoyu Liu, Minghui Liu, James Montgomery, Nam H Nguyen, C. Bayan Bruss, Furong Huang

机构 * Capital One Google(谷歌) University of Maryland, College Park(马里兰大学学院 park 分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PersonaLedger通过基于人设的LLM和规则驱动的反馈生成逼真的财务交易,提供隐私保护的数据集和基准测试,支持金融AI的创新与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05239 2026-01-22 cs.CL 77%

Translation via Annotation: A Computational Study of Translating Classical Chinese into Japanese

通过注释进行翻译:对中国古典汉语翻译成日语的计算研究

Zilong Li, Jie Cao

机构 * Department of Linguistics University of Colorado, Boulder(语言学系科罗拉多大学博尔德分校) School of Computer Science University of Oklahoma(计算机科学学院俄克拉荷马大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过注释系统将古典汉语翻译成日语,利用LLM和新数据集提升低资源环境下序列标注任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15016 2026-01-22 cs.CV 75%

LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding

LiViBench:面向交互式直播视频理解的多模态基准测试

Xiaodong Wang, Langling Huang, Zhirong Wu, Xu Zhao, Teng Xu, Xuhong Xia, Peixi Peng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 LiViBench是首个面向交互式直播视频的多模态基准测试,通过定制化两阶段指令微调和视频到评论检索模块,提升模型对直播视频的理解能力,并在多个基准测试中取得优异成绩。

Comments AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14546 2026-01-22 cs.IR 75%

Predicting Retrieval Utility and Answer Quality in Retrieval-Augmented Generation

在检索增强生成中预测检索效用和答案质量

Fangzheng Tian, Debasis Ganguly, Craig Macdonald

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出在检索增强生成中通过预测检索文档效用和答案质量来提升生成性能。

Comments 18 pages (including reference), 3 figures, 2 table, 61 references; this paper has been accepted by ECIR'26 as a full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14994 2026-01-22 cs.CL cs.AI 73%

Obscuring Data Contamination Through Translation: Evidence from Arabic Corpora

通过翻译掩盖数据污染:来自阿拉伯语语料库的证据

Chaymaa Abbas, Nour Shamaa, Mariette Awad

机构 * Department of Electrical and Computer Engineering, Maroun Semaan Faculty of Engineering and Architecture(电气与计算机工程系,马鲁恩·塞马安工程与建筑学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过阿拉伯语翻译实验发现,数据污染在多语言环境下表现复杂,提出翻译感知污染检测方法以提升LLM评估的公平性与透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14311 2026-01-22 cs.CR cs.AI cs.LG 73%

Tracing the Data Trail: A Survey of Data Provenance, Transparency and Traceability in LLMs

追踪数据轨迹:对大型语言模型中数据溯源、透明性和可追溯性的综述

Richard Hohensinner, Belgin Mutlu, Inti Gabriel Mendoza Estrada, Matej Vukovic, Simone Kopeinik, Roman Kern

机构 * Pro2Future GmbH Know Center Research GmbH Graz University of Technology(格拉茨技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了大型语言模型中数据溯源、透明性和可追溯性的问题,提出分类法并分析了数据生成、水印、偏见测量等关键方法及透明性与隐私的权衡。

Comments 35 pages, 6 figures. Manuscript submitted to ACM Computing Surveys (CSUR) on the 12th of December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏