arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-03 至 2026-02-03 共收录 608 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 116 篇

2602.00676 2026-02-03 cs.AI cs.MA 70%

OpenGuanDan: A Large-Scale Imperfect Information Game Benchmark

OpenGuanDan: 一个大规模非完全信息游戏基准

Chao Li, Shangdong Yang, Chiheng Zhan, Zhenxing Ge, Yujing Hu, Bingkun Bao, Xingguo Chen, Yang Gao

机构 * School of Computer Science, Nanjing University of Posts(南京邮电大学计算机科学学院) NetEase Fuxi AI Lab, Netease Inc(网易凤凰AI实验室,网易公司) School of Intelligent Science(智能科学学院) Technology, Nanjing University(技术,南京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OpenGuanDan是一个用于评估多智能体决策算法的新型大规模非完全信息游戏基准,通过模拟中国四人纸牌游戏并支持人机对抗,揭示了当前AI在复杂决策任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19802 2026-02-03 cs.CL 70%

Zero-Shot Stance Detection in the Wild: Dynamic Target Generation and Multi-Target Adaptation

野外零样本立场检测:动态目标生成与多目标适应

Aohua Li, Yuanshuo Zhang, Ge Gao, Bo Chen, Xiaobing Zhao

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) National Language Resource Monitoring and Research Center of Minority Languages, Beijing(少数民族语言资源监测与研究中心) Institute of National Security, Minzu University of China(中国民族大学国家安全学院) School of Minority Languages and Literatures, Minzu University of China(中国民族大学少数民族语言文学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出野外零样本立场检测任务,通过动态目标生成和多目标适应方法,利用微调后的大型语言模型在社交媒体文本中实现高精度的目标-立场识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03708 2026-02-03 cs.PL cs.AI 70%

MHRC-Bench: A Multilingual Hardware Repository-Level Code Completion benchmark

MHRC-Bench: 一个多语言硬件仓库级代码补全基准

Qingyun Zou, Jiahao Cui, Nuo Chen, Bingsheng He, Weng-Fai Wong

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MHRC-Bench是首个多语言硬件仓库级代码补全基准,涵盖三种硬件设计编码风格,通过代码结构和硬件导向语义标签进行补全任务评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07450 2026-02-03 cs.CV cs.CL 70%

GLEAM: Learning to Match and Explain in Cross-View Geo-Localization

GLEAM: 在跨视图地理定位中学习匹配与解释

Xudong Lu, Zhi Zheng, Yi Wan, Yongxiang Yao, Annan Wang, Renrui Zhang, Panwang Xia, Qiong Wu, Qingyun Li, Weifeng Lin, Xiangyu Zhao, Peifeng Ma, Xue Yang, Hongsheng Li

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GLEAM提出了一种结合多模态、多视角对齐与可解释对应分析的CVGL方法,通过双阶段训练策略提升精度并增强可解释性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05172 2026-02-03 cs.CL 70%

From Lengthy to Lucid: A Systematic Literature Review on NLP Techniques for Taming Long Sentences

从冗长到清晰:一项关于NLP技术用于驯服长句子的系统文献综述

Tatiana Passali, Efstathios Chatzikyriakidis, Stelios Andreadis, Thanos G. Stavropoulos, Anastasia Matonaki, Anestis Fachantidis, Grigorios Tsoumakas

机构 * Aristotle University of Thessaloniki(亚里士多德大学) Medoid AI Pfizer Center for Digital Innovation(辉瑞数字创新中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文系统综述了NLP中处理长句子的两种主要技术:句子压缩和分割,并探讨了当前方法的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00370 2026-02-03 cs.AI 70%

POET: Protocol Optimization via Eligibility Tuning

通过资格调整实现协议优化:POET

Trisha Das, Katherine Kero, Dorinda Schumann, Tracy Ohrt, Sanjit Singh Batra, Gregory D Lyng, Robert E. Tillman

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Optum Optum AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 POET通过引入可解释的语义轴,为临床试验设计提供了一种实用且可解释的AI辅助生成资格标准的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01623 2026-02-03 cs.CV 67%

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?

Susan Liang, Chao Huang, Filippos Bellos, Yolo Yunlong Tang, Qianxiang Shen, Jing Bi, Luchuan Song, Zeliang Zhang, Jason Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20918 2026-02-03 cs.SE 67%

Infusion of Blockchain to Establish Trustworthiness in AI Supported Software Evolution: A Systematic Literature Review

将区块链融入建立AI支持的软件演进中的可信度:一项系统文献综述

Mohammad Naserameri, Juergen Rilling

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过系统文献综述探讨了区块链在提升AI支持的软件演进中可信度的作用,指出需建立可衡量的可信度框架以确保安全和合规的AI驱动软件生态系统。

Comments This paper is a preprint of a manuscript submitted for journal publication. The accompanying dataset supporting this systematic literature review is publicly available on Zenodo

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05427 2026-02-03 cs.CV 67%

OpenWorldSAM: Extending SAM2 for Universal Image Segmentation with Language Prompts

OpenWorldSAM: 通过语言提示扩展SAM2实现通用图像分割

Shiting Xiao, Rishabh Kabra, Yuhang Li, Donghyun Lee, Joao Carreira, Priyadarshini Panda

机构 * Yale University(耶鲁大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 OpenWorldSAM通过整合轻量级视觉-语言模型,扩展SAM2实现开放词汇图像分割,具备高效、实例意识和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13620 2026-02-03 cs.SE 67%

Programming Language Confusion: When Code LLMs Can't Keep their Languages Straight

编程语言混淆:当代码LLM无法保持语言一致

Micheline Bénédicte Moumoula, Serge Lionel Nikiema, Abdoul Kader Kabore, Jacques Klein, Tegawendé F. Bissyande

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究揭示代码LLM在编程语言混淆问题上的系统性错误,提出通过显式语言关键词缓解,并倡导标准化评估以提升多语言代码生成系统的可靠性。

Comments Accepted for publication at SANER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01291 2026-02-03 cs.LO 67%

Construction-Verification: A Benchmark for Applied Mathematics in Lean 4

构造-验证:Lean 4中的应用数学基准

Bowen Yang, Yi Yuan, Chenyi Li, Ziyu Wang, Liangqi Li, Bo Zhang, Zhe Li, Zaiwen Wen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出Lean 4中的构造-验证框架,通过AMBER基准评估应用数学领域中显式解决方案合成与验证能力,揭示通用模型在复杂构造任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01038 2026-02-03 cs.CV 67%

From Videos to Conversations: Egocentric Instructions for Task Assistance

从视频到对话:任务协助的视角指令

Lavisha Aggarwal, Vikas Bahirwani, Andrea Colaco

机构 * Google, USA(谷歌)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出从视频自动转换为多模态任务指导对话的框架,并引入HowToDIV数据集,用于多模态任务协助的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00757 2026-02-03 cs.SE 67%

ScratchEval : A Multimodal Evaluation Framework for LLMs in Block-Based Programming

ScratchEval:一种用于块式编程中LLM的多模态评估框架

Yuan Si, Simeng Han, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 评测与基准 :LLM(abstract);post-training(abstract)

AI总结 ScratchEval是首个用于评估LLM在Scratch块式编程中修复能力的可执行基准,通过多层协议测量功能正确性、修复质量和解释质量,支持领域微调和泛化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06582 2026-02-03 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

TabRAG: Improving Tabular Document Question Answering for Retrieval Augmented Generation via Structured Representations

TabRAG:通过结构化表示改进表格文档问答以增强检索增强生成

Jacob Si, Mike Qu, Michelle Lee, Marek Rei, Yingzhen Li

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TabRAG通过结构化表示改进表格文档问答,采用布局分割和视觉语言模型解析,提升表格问答性能。

Comments NeurIPS 2025 AI4Tab

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01675 2026-02-03 cs.AI cs.LG 62%

TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios

TRIP-Bench:面向现实场景的长周期交互智能体基准

Yuanzhe Shen, Zisu Huang, Zhengyuan Wang, Muzhao Tian, Zhengkang Guo, Chenyang Zhang, Shuaiyu Zhou, Zengjie Hu, Dailin Li, Jingwen Xu, Kaimin Wang, Wenhao Liu, Tianlong Li, Fengpeng Yue, Feng Hong, Cao Liu, Ke Zeng

机构 * Xiaohongshu Inc.(小红书公司) School of Computer Science, Fudan University(复旦大学计算机学院) Dalian University of Technology(大连理工大学) Peking University(北京大学) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Bench是一个面向现实场景的长周期交互智能体基准,通过真实旅行规划场景测试多工具推理与约束满足,提出GTPO方法提升智能体鲁棒性与性能。

Comments 40 pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01600 2026-02-03 cs.CR cs.CL cs.CY cs.LG 62%

Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs

预期危害:重新思考对(误)对齐大语言模型的安全性评估

Yen-Shan Chen, Zhi Rui Tam, Cheng-Kuang Wu, Yun-Nung Chen

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出预期危害指标,通过分析发现模型对高成本低可能性威胁的拒绝行为与高可能性低成本威胁的易受攻击现象,揭示模型对执行成本的

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09751 2026-02-03 cs.LG cs.AI 62%

Meta-Learning Reinforcement Learning for Crypto-Return Prediction

元学习强化学习用于加密货币收益预测

Junqiao Wang, Zhaoyang Guan, Guanyu Liu, Tianze Xia, Xianzhi Li, Shuo Yin, Xinyuan Song, Chuhan Cheng, Tianyu Shi, Alex Lee

机构 * Sichuan University(四川大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Northwestern University(西北大学) Huazhong University of Science and Technology(华中科技大学) Queen’s University(女王大学) University of Toronto(多伦多大学) TrueNorth Tsinghua University(清华大学) Emory University(埃默里大学) University of Macau(澳门大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Meta-RL-Crypto通过结合元学习和强化学习,构建了一个自我改进的交易代理,有效提升加密货币收益预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00393 2026-02-03 cs.CV cs.CL cs.LG 62%

Brazilian Portuguese Image Captioning with Transformers: A Study on Cross-Native-Translated Dataset

巴西葡萄牙语图像描述生成:跨原生翻译数据集研究

Gabriel Bromonschenkel, Alessandro L. Koerich, Thiago M. Paixão, Hilário Tomaz Alves de Oliveira

机构 * Instituto Federal do Espírito Santo (IFES)(巴西联邦大学埃斯皮里图圣安东尼奥理工学院) École de Technologie Supérieure (ÉTS)(加拿大超技术学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过跨原生翻译数据集评估Transformer模型在巴西葡萄牙语图像描述生成中的表现,发现Swin-DistilBERTimbau表现优异,GPT-4在CLIP-Score上表现最佳,同时揭示了模型中的系统性偏见。

Comments Accepted to JBCS. 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00046 2026-02-03 cs.LG cs.CL 62%

Extending Beacon to Hindi: Cultural Adaptation Drives Cross-Lingual Sycophancy

将Beacon扩展到印地语:文化适应驱动跨语言趋炎附势

Sarthak Sattigeri

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过文化适应提示评估语言模型在印地语中的趋炎附势现象,发现文化因素对跨语言对齐行为有显著影响。

Comments First Hindi sycophancy benchmark using a three-condition design separating language and cultural effects, with empirical evaluation across four instruction-tuned models

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03205 2026-02-03 cs.CL cs.AI 62%

U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs

U-MATH:一个大学级评估LLM数学能力的基准测试

Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

机构 * Toloka AI Gradarius Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 U-MATH是一个大学级数学能力评估基准,包含1100个开放性问题,用于评估LLM在多模态推理和解决方案判断方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02475 2026-02-03 cs.AI 57%

AgentRx: Diagnosing AI Agent Failures from Execution Trajectories

AgentRx: 从执行轨迹诊断AI代理故障

Shraddha Barke, Arnav Goyal, Alind Khare, Avaljot Singh, Suman Nath, Chetan Bansal

机构 * Microsoft Research(微软研究院) Microsoft(微软)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 AgentRx通过自动化诊断框架,从执行轨迹中定位AI代理的关键故障步骤,并提升跨领域的故障归因能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22161 2026-02-03 cs.LG cs.CV cs.SD eess.AS 57%

Attention Isn't All You Need for Emotion Recognition:Domain Features Outperform Transformers on the EAV Dataset

注意力并非情感识别的全部:在EAV数据集上领域特征优于Transformer

Anmol Guragain

机构 * Universidad Politécnica de Madrid E.T.S. Ingenieros de Telecomunicación(马德里理工大学电信工程学院)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 在EAV数据集上,领域特征在小数据情感识别中优于Transformer,通过简单修改提升准确率,证明领域知识胜过复杂架构。

Comments 2 figures, 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07477 2026-02-03 cs.AI 57%

JudgeFlow: Agentic Workflow Optimization via Block Judge

JudgeFlow: 通过块判断实现代理工作流优化

Zihan Ma, Zhikai Zhao, Chuanbo Hua, Federico Berto, Jinkyoo Park

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 JudgeFlow通过引入可配置的逻辑块和专用判断模块,实现代理工作流的高效优化,提升样本效率和可解释性,并在数学推理和代码生成任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01452 2026-02-03 cs.CV cs.AI 57%

Cross-Paradigm Evaluation of Gaze-Based Semantic Object Identification for Intelligent Vehicles

跨范式评估基于注视的语义物体识别用于智能车辆

Penghao Deng, Jidong J. Yang, Jiachen Bian

机构 * Smart Mobility & Infrastructure Laboratory(智能移动与基础设施实验室) College of Engineering, University of Georgia(工程学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文通过三种方法评估基于注视的语义物体识别,发现大型VLM在识别小型安全关键物体上表现优异,但传统检测器在实时性上更高效。

Comments 21 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01239 2026-02-03 cs.CL cs.IR 57%

Inferential Question Answering

推断性问答

Jamshid Mozafari, Hamed Zamani, Guido Zuccon, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) The University of Queensland(昆士兰大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出推断性QA任务,通过构建QUIT数据集,发现传统QA方法在推断任务中表现不佳,揭示当前QA流程难以处理基于推断的推理。

Comments Proceedings of the ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00811 2026-02-03 cs.AI 57%

MissMAC-Bench: Building Solid Benchmark for Missing Modality Issue in Robust Multimodal Affective Computing

MissMAC-Bench: 构建缺失模态问题的坚实基准以提升鲁棒多模态情感计算

Ronghao Lin, Honghao Lu, Ruixing Wu, Aolin Xiong, Qinggong Chu, Qiaolin He, Sijie Mai, Haifeng Hu

机构 * Sun Yat-Sen University(中山大学) South China Normal University(华南师范大学) Pazhou Laboratory(琶洲实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 MissMAC-Bench通过构建统一评估标准和跨模态协同原则,系统量化缺失模态问题,提升多模态情感计算的鲁棒性和实际应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00635 2026-02-03 cs.CV cs.AI 57%

S$^3$POT: Contrast-Driven Face Occlusion Segmentation via Self-Supervised Prompt Learning

S$^3$POT: 通过自监督提示学习实现对比驱动的人脸遮挡分割

Lingsong Wang, Mancheng Meng, Ziyan Wu, Terrence Chen, Fan Yang, Dinggang Shen

机构 * ShanghaiTech University(上海科技大学) United Imaging Intelligence(联影智能)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 S$^3$POT通过自监督提示学习实现对比驱动的人脸遮挡分割,结合人脸生成与空间提示,提升遮挡区域分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00539 2026-02-03 cs.LG 57%

OpenDDI: A Comprehensive Benchmark for DDI Prediction

OpenDDI: 一种全面的DDI预测基准

Xinmo Jin, Bowen Fan, Xunkai Li, Henan Sun, YuXin Zeng, Zekai Chen, Yuxuan Sun, Jia Li, Qiangqiang Dai, Hongchao Qin, Rong-Hua Li, Guoren Wang

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 OpenDDI提出一个全面的DDI预测基准,统一了多种数据集和评估标准,揭示了当前DDI预测的局限性并提供了关键指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20327 2026-02-03 cs.CL 57%

CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria

CE-RM:一种通过两阶段回放和统一标准优化的点wise生成奖励模型

Xinyu Hu, Yancheng He, Weixun Wang, Tao Feng, Li Lin, Jiashun Liu, Wenbo Su, Bo Zheng, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) Hong Kong University of Science and Technology(香港理工大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 CE-RM通过两阶段回放和统一标准优化,提升生成奖励模型在开放性自然语言生成和强化学习中的表现。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17218 2026-02-03 cs.IR cs.LG 57%

Evaluation on Entity Matching in Recommender Systems

推荐系统中实体匹配的评估

Zihan Huang, Rohan Surana, Zhouhang Xie, Junda Wu, Yu Xia, Julian McAuley

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出Reddit-Amazon-EM数据集,通过手动标注评估推荐系统中实体匹配方法,为相关研究提供可复现的资源。

详情

展开后加载摘要…

URL PDF HTML 收藏