arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-06 至 2026-01-06 共收录 264 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 71 篇

2601.01743 2026-01-06 cs.AI 70%

AI Agent Systems: Architectures, Applications, and Evaluation

AI代理系统:架构、应用与评估

Bin Xu

机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文综述了AI代理系统在架构、应用与评估方面的最新进展,探讨了代理组件、协调模式及部署设置,并分析了设计权衡与评估挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01320 2026-01-06 cs.SE cs.AI 70%

Adaptive Hierarchical Evaluation of LLMs and SAST tools for CWE Prediction in Python

自适应层次评估LLM和SAST工具用于Python中的CWE预测

Muntasir Adnan, Carlos C. N. Kuhn

机构 * Open Source Institute Faculty of Science(开源研究所科学学院) Technology University of Canberra Canberra, Australia(技术大学堪培拉澳大利亚)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ALPHA基准,通过层次化惩罚评估LLM和SAST工具在Python中CWE预测的性能,发现LLM在整体表现上优于SAST,但SAST在检测发生时精度更高,且模型间预测一致性差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04838 2026-01-06 cs.CL 70%

DAMASHA: Detecting AI in Mixed Adversarial Texts via Segmentation with Human-interpretable Attribution

DAMASHA:通过可解释的归因进行混合对抗文本中AI的检测

L. D. M. S. Sai Teja, N. Siva Gopala Krishna, Ufaq Khan, Muhammad Haris Khan, Atul Mishra

机构 * NIT Silchar(Silchar国立理工学院) BML Munjal(BML穆纳尔) MBZUAI(穆罕默德·本·拉希德智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DAMASHA通过整合风格学线索、困惑度信号和结构化边界建模,提高混合作者文本分割的鲁棒性,并引入可解释的归因以增强可理解性。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03663 2026-01-06 cs.CL cs.CV 70%

UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG

UNIDOC-BENCH: 一个统一的文档中心多模态RAG基准

Xiangyu Peng, Can Qin, Zeyuan Chen, Ran Xu, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 UniDoc-Bench是首个大规模文档中心多模态RAG基准,通过多模态问答对评估文本-图像融合与联合检索性能,揭示多模态嵌入不足及视觉上下文补充机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00841 2026-01-06 cs.LG 70%

SLO-Conditioned Action Routing for Retrieval-Augmented Generation: Objective Ablation and Failure Modes

基于SLO的检索增强生成中的动作路由:目标消融与失败模式

Bharath Nunepalli

机构 * Medium

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.LG

AI总结 本研究提出基于SLO的RAG控制方法,通过动作路由优化检索深度和生成模式,在质量导向SLO下实现成本节约,但在廉价SLO下可能导致拒绝崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02570 2026-01-06 cs.CV 67%

TI-PREGO: Chain of Thought and In-Context Learning for Online Mistake Detection in PRocedural EGOcentric Videos

TI-PREGO:基于思维链和上下文学习的在线程序错误检测方法

Leonardo Plini, Luca Scofano, Edoardo De Matteis, Guido Maria D'Amely di Melendugno, Alessandro Flaborea, Andrea Sanchietti, Giovanni Maria Farinella, Fabio Galasso, Antonino Furnari

机构 * Sapienza University of Rome(萨皮恩扎罗马大学) ItalAI University of Catania(卡塔尼亚大学) National Institute of Nuclear Physics - LNF(国家核物理研究所 - LNF)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 TI-PREGO通过双分支架构结合思维链和上下文学习,实现对第一人称视频中开放集程序错误的在线检测,展现方法在动态场景中的鲁棒性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01432 2026-01-06 stat.ME stat.ML 67%

Personalizing black-box models for nonparametric regression with minimax optimality

为非参数回归实现黑盒模型的个性化:最小最大最优性

Sai Li, Linjun Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种在非参数回归中实现黑盒模型个性化的方法,通过理论分析和实验验证,证明了其在样本稀缺情况下的最优性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01239 2026-01-06 cs.SD cs.CR cs.MM eess.AS 67%

IO-RAE: Information-Obfuscation Reversible Adversarial Example for Audio Privacy Protection

IO-RAE:信息混淆可逆对抗示例用于音频隐私保护

Jiajie Zhu, Xia Du, Xiaoyuan Liu, Jizhe Zhou, Qizhen Xu, Zheng Lin, Chi-Man Pun

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 IO-RAE通过可逆对抗示例保护音频隐私,有效防止未经授权的窃听和分析,实验显示其在多个ASR模型中达到高误引导率和无损恢复效果。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16320 2026-01-06 cs.SE 67%

Issue2Test: Generating Reproducing Test Cases from Issue Reports

Issue2Test: 从问题报告中生成可重复测试用例

Noor Nashid, Islem Bouzenia, Michael Pradel, Ali Mesbah

专题命中 评测与基准 :LLM(abstract);foundation model(abstract)

AI总结 Issue2Test通过生成失败测试用例来自动复现GitHub问题,提升了问题解决效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00880 2026-01-06 cs.AI cs.CL cs.LG cs.PL cs.SE 67%

Universal Conditional Logic: A Formal Language for Prompt Engineering

通用条件逻辑:一种提示工程的形式语言

Anthony Mikinka

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通用条件逻辑通过系统优化框架提升提示工程效率,实现显著token减少和成本节约,适用于不同模型架构的定制化优化。

Comments 25 pages, 15 figures, 5 tables. Includes appendices with variable reference, pattern library, and O_s calculation examples. Supplementary materials: V1-V4.1 prompt source code and 305 model responses available at GitHub repositories

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02200 2026-01-06 cs.SE cs.AI 61%

Code for Machines, Not Just Humans: Quantifying AI-Friendliness with Code Health Metrics

为机器编写代码,而非仅为人类:通过代码健康度指标量化AI友好性

Markus Borg, Nadim Hagatulah, Adam Tornhill, Emma Söderberg

机构 * Lund University(Lund 大学) CodeScene and Lund University(CodeScene 和 Lund 大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI;foundation model(comments)

AI总结 本文通过分析5000个Python文件,探讨了AI友好的代码概念,发现代码健康度与AI重构后的语义保持相关,表明提升代码可维护性对人类和AI都有益。

Comments Accepted for the 3rd ACM International Conference on AI Foundation Models and Software Engineering (FORGE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02045 2026-01-06 cs.PL cs.AI cs.SE 57%

The New Compiler Stack: A Survey on the Synergy of LLMs and Compilers

新的编译器栈:关于大型语言模型与编译器协同的综述

Shuoming Zhang, Jiacheng Zhao, Qiuchu Yu, Chunwei Xia, Zheng Wang, Xiaobing Feng, Huimin Cui

机构 * SKLP Institute of Computing Technology, CAS(计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Leeds(利兹大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文综述了大型语言模型与编译器协同的新兴领域,提出了多维度分类法,揭示了LLMs在编译器开发中的三大优势,并指明了混合系统的发展路径。

Comments Accepted by CCF Transactions on High Performance Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01842 2026-01-06 cs.CL 57%

Towards Automated Lexicography: Generating and Evaluating Definitions for Learner's Dictionaries

迈向自动词典编纂:生成和评估学习者词典中的定义

Yusuke Ide, Adam Nohejl, Joshua Tanner, Hitomi Yanaka, Christopher Lindsay, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学) RIKEN(日本研究机构) Resolve Research(Resolve研究) The University of Tokyo(东京大学) Tohoku University(东北大学) Serpenti Sei Japan(日本Serpenti Sei)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出了一种基于LLM的自动学习者词典定义生成方法,通过迭代简化生成简单词汇定义,并引入了新的评估标准以提高词典编纂的自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01024 2026-01-06 cs.CV cs.AI cs.IR 57%

ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval

ITSELF: 基于注意力引导的细粒度对齐用于视觉-语言检索

Tien-Huy Nguyen, Huu-Loc Tran, Thanh Duc Ngo

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 ITSELF通过基于注意力引导的细粒度对齐框架,在视觉-语言检索任务中实现最先进的性能和跨数据集泛化能力。

Comments Accepted at WACV Main Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24572 2026-01-06 cs.CL 57%

Korean Canonical Legal Benchmark: Toward Knowledge-Independent Evaluation of LLMs' Legal Reasoning Capabilities

韩国规范法律基准:迈向独立于领域知识的LLM法律推理能力评估

Hongseok Oh, Wonseok Hwang, Kyoung-Woon On

机构 * University of Seoul(首尔大学) LBOX

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 韩国规范法律基准通过问题级支持先例评估LLM法律推理能力,揭示领域知识依赖下的模型差距,展示推理专用模型的优越性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14420 2026-01-06 cs.CV cs.AI 57%

DISCODE: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning

DISCODE:面向分布的评分解码器,用于鲁棒的图像描述评估

Nakamasa Inoue, Kanoko Goto, Masanari Oi, Martyna Gruszka, Mahiro Ukai, Takumi Hirose, Yusuke Sekikawa

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 DISCODE是一种无需微调的鲁棒图像描述评估方法,通过自适应测试时损失和多领域基准提升评估鲁棒性。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10393 2026-01-06 cs.SE cs.AI 57%

Cross-modal Retrieval Models for Stripped Binary Analysis

用于剥离二进制分析的跨模态检索模型

Guoqiang Chen, Lingyun Ying, Ziyang Song, Daguang Liu, Qiang Wang, Zhiqi Wang, Li Hu, Shaoyin Cheng, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) QI-ANXIN Technology Research Institute(QI-ANXIN技术研究所)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出BinSeek模型,通过两阶段跨模态检索框架实现对剥离二进制代码的高效检索,显著提升二进制代码与自然语言描述的相关性检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16202 2026-01-06 cs.AI 57%

Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning

多智能体协作奖励设计以增强强化学习中的推理

Pei Yang, Ke Zhang, Ji Wang, Xiao Chen, Yuxin Tang, Eric Yang, Lynn Ai, Bill Shi

机构 * Gradient Waseda University(早稻田大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Rice University(莱斯大学)

专题命中 评测与基准 :RLHF(abstract);分类 cs.AI

AI总结 多智能体协作奖励模型通过分解偏好评估和引入集中化聚合器,提升强化学习中的鲁棒性和可解释性,同时提供透明的奖励建模方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12692 2026-01-06 cs.CL 57%

FormulaReasoning: A Dataset for Formula-Based Numerical Reasoning

FormulaReasoning:一个用于基于公式的数值推理的数据集

Xiao Li, Bolin Zhu, Kaiwen Shi, Sichen Liu, Yin Zhu, Yiwei Liu, Gong Cheng

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 FormulaReasoning数据集通过引入基于物理原理的数值推理任务,提供细粒度注释和扩展版本,评估多种推理框架,揭示公式推理中的关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00848 2026-01-06 cs.AI cs.CR 57%

Temporal Attack Pattern Detection in Multi-Agent AI Workflows: An Open Framework for Training Trace-Based Security Models

多智能体AI工作流中的时间攻击模式检测:一种用于训练基于轨迹的安全模型的开放框架

Ron F. Del Rosario

机构 * SAP OWASP Gen AI Security Project(OWASP生成人工智能安全项目) Agentic Security Initiative (ASI)(代理安全倡议(ASI))

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种开放框架,通过合成轨迹生成和微调语言模型,提升多智能体AI工作流中时间攻击模式检测的准确性,并公开了相关数据集和评估基准。

Comments 26 pages, 3 figures, 7 tables. Datasets and code: https://huggingface.co/guerilla7/agentic-safety-gguf

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02304 2026-01-06 cs.DB 50%

Octopus: A Lightweight Entity-Aware System for Multi-Table Data Discovery and Cell-Level Retrieval

Octopus: 一种轻量级的实体感知多表数据发现与单元格级检索系统

Wen-Zhi Li, Sainyam Galhotra

专题命中 评测与基准 :LLM(abstract)

AI总结 Octopus是一种无需训练的轻量级系统,通过细粒度实体识别和直接扫描表内容,实现多表数据发现和单元格级值检索,提高准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01870 2026-01-06 cs.CV 50%

Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion

实体引导的多任务学习用于红外和可见图像融合

Wenyu Shao, Hongbo Liu, Yunchuan Ma, Ruili Wang

专题命中 评测与基准 :language model(abstract)

AI总结 EGMT通过实体引导的多任务学习方法,提升红外和可见图像融合的语义一致性与质量。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23413 2026-01-06 cs.CV 50%

Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment

弥合认知鸿沟:面向艺术图像美学评估的层次描述学习

Henglin Liu, Nisha Huang, Chang Liu, Jiangpeng Yan, Huijuan Huang, Jixuan Ying, Tong-Yee Lee, Pengfei Wan, Xiangyang Ji

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出RAD数据集和ArtQuant框架,通过联合描述生成和LLM解码器提升艺术图像美学评估的准确性和效率。

Comments AAAI2026,Project Page:https://github.com/Henglin-Liu/ArtQuant

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07137 2026-01-06 cs.CV 50%

MPJudge: Towards Perceptual Assessment of Music-Induced Paintings

MPJudge:迈向音乐诱导绘画的感知评估

Shiqi Jiang, Tianyi Liang, Huayuan Ye, Changbo Wang, Chenhui Li

专题命中 评测与基准 :preference optimization(abstract)

AI总结 MPJudge通过调制融合机制和直接偏好优化,提升音乐诱导绘画的感知评估精度。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02565 2026-01-06 cs.CV 50%

SJTU:Spatial judgments in multimodal models towards unified segmentation through coordinate detection

上海交通大学:通过坐标检测实现多模态模型中的空间判断以实现统一分割

Joongwon Chae, Zhenyu Wang, Peiwu Qin

专题命中 评测与基准 :language model(abstract)

AI总结 SJTU通过坐标检测实现多模态模型中的空间判断,提升图像分割的准确性和实用性。

Comments A flaw was discovered in the experimental setup. Therefore, we are retracting the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06524 2026-01-06 cs.DM 50%

A heuristic search algorithm for discovering large Condorcet domains

发现大Condorcet域的启发式搜索算法

Bei Zhou, Søren Riis

专题命中 评测与基准 :prompting(abstract)

AI总结 本文提出了一种新的启发式搜索算法,用于发现更大规模的Condorcet域,成功提升了n=10和n=11的CD大小记录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00879 2026-01-06 cs.CV 50%

VL-OrdinalFormer: Vision Language Guided Ordinal Transformers for Interpretable Knee Osteoarthritis Grading

VL-OrdinalFormer:基于视觉语言引导的序数变换器用于可解释的膝关节骨关节炎分级

Zahid Ullah, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系) Dongguk University(东国大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 VL-OrdinalFormer通过结合视觉语言引导的序数学习框架,实现膝关节骨关节炎的可解释性分级,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00839 2026-01-06 cs.CV 50%

Unified Review and Benchmark of Deep Segmentation Architectures for Cardiac Ultrasound on CAMUS

针对心脏超声的深度分割架构的统一回顾与基准测试:CAMUS

Zahid Ullah, Muhammad Hilal, Eunsoo Lee, Dragan Pamucar, Jihie Kim

机构 * Department of Computer Science Artificial Intelligence, Dongguk University, Seoul 04620, Republic of Korea Department of Semiconductor System Engineering, Sejong University, Seoul, 05006, Republic of Korea Department of Operations Research Statistics, Faculty of Organizational Sciences, University of Belgrade, Belgrade, Serbia Department of Industrial Engineering \& Management, Yuan Ze University, Taoyuan City 320315, Taiwan Department of Applied Mathematical Science, College of Science Technology, Korea University, Sejong 30019, Republic of Korea

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文通过统一基准测试评估了三种心脏超声分割架构的性能,提出标准化预处理方法,并展望了自监督和多模态标注技术的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 43 篇

2504.14772 2026-01-06 cs.CL cs.LG stat.ML 90%

Knowledge Distillation and Dataset Distillation of Large Language Models: Emerging Trends, Challenges, and Future Directions

大型语言模型的知识蒸馏与数据集蒸馏:新兴趋势、挑战与未来方向

Luyang Fang, Xiaowei Yu, Jiazhang Cai, Yongkai Chen, Shushan Wu, Zhengliang Liu, Zhenyuan Yang, Haoran Lu, Xilin Gong, Yufang Liu, Terry Ma, Wei Ruan, Ali Abbasi, Jing Zhang, Tao Wang, Ehsan Latif, Weihang You, Hanqi Jiang, Wei Liu, Wei Zhang, Soheil Kolouri, Xiaoming Zhai, Dajiang Zhu, Wenxuan Zhong, Tianming Liu, Ping Ma

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了大型语言模型的知识蒸馏与数据集蒸馏技术,探讨了其在压缩模型、保持推理能力及语言多样性方面的挑战与未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01774 2026-01-06 cs.AI cs.CE cs.NA math.NA 89%

Can Large Language Models Solve Engineering Equations? A Systematic Comparison of Direct Prediction and Solver-Assisted Approaches

大型语言模型能解决工程方程吗?直接预测与求解器辅助方法的系统比较

Sai Varun Kodathala, Rakesh Vunnam

机构 * Research and Development Sports Vision, Inc.(Sports Vision公司研发部) Research and Development Vizworld, Inc.(Vizworld公司研发部)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型在解决工程方程中的表现,发现求解器辅助方法在精度上显著优于直接预测,尤其在电子领域效果突出。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏