arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-08 至 2025-12-08 共收录 139 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31 篇

2512.05137 2025-12-08 cs.CV cs.AI 79%

ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images

ChromouVQA:在色度伪装图像下评估视觉-语言模型的基准测试

Yunfei Zhang, Yizhuo He, Yuanxun Shao, Zhengtao Yao, Haoyan Xu, Junhao Dong, Zhen Yao, Zhikang Dong

机构 * Amazon(亚马逊公司) Google(谷歌公司) MurcuryMind(MurcuryMind公司) University of Southern California(南加州大学) Nanyang Technological University(南洋理工大学) Lehigh University(莱斯大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 ChromouVQA通过色度伪装图像评估视觉-语言模型在复杂背景下的表现,提出对比度配方提升形状恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05449 2025-12-08 cs.AI 77%

The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems

计划的种子:代理系统构建块中的弱点意志

Robert Yang

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出将'意志薄弱'作为分析代理AI系统不一致性和目标漂移的基础概念,并引入Akrasia基准以评估模型的自我控制能力。

Comments 4 pages + appendix. AAAI 2026 FAST Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05176 2025-12-08 cs.SE cs.AI cs.HC 77%

Towards A Cultural Intelligence and Values Inferences Quality Benchmark for Community Values and Common Knowledge

迈向社区价值观和常识的文化智能与价值观推理质量基准

Brittany Johnson, Erin Reddick, Angela D. R. Smith

机构 * George Mason University(乔治·马歇尔大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CIVIQ基准,旨在通过社区价值观和常识对齐提升文化智能,填补美国文化多样性下的评估空白。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05659 2025-12-08 econ.GN q-fin.EC 75%

Beyond Automation: Redesigning Jobs with LLMs to Enhance Productivity

超越自动化:利用LLMs重新设计工作以提高生产率

Andrew Ledingham, Michael Hollins, Matthew Lyon, David Gillespie, Umar Yunis-Guerra, Jamie Siviter, David Duncan, Oliver P. Hauser

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文利用LLMs重新设计工作以提高生产率,发现人类在战略领导、复杂问题解决和利益相关者管理等方面具有比较优势,同时强调生产率提升而非角色替代是AI经济价值的主要来源。

Comments 98 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05202 2025-12-08 cs.DL 75%

Can ChatGPT evaluate research environments? Evidence from REF2021

ChatGPT能否评估研究环境?来自REF2021的证据

Kayvan Kousha, Mike Thelwall, Elizabeth Gadd

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究ChatGPT能否评估研究环境,发现其在REF2021中与专家评分呈正相关,但存在偏见和系统性影响的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05288 2025-12-08 cs.CR cs.AI cs.LG 73%

Beyond Detection: A Comprehensive Benchmark and Study on Representation Learning for Fine-Grained Webshell Family Classification

超越检测:面向细粒度Webshell家族分类的全面基准和研究

Feijiang Han

机构 * Feijiang Han(韩菲江)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自动化WebShell家族分类方法,通过动态函数调用轨迹和图结构抽象,评估多种表示方法以提升细粒度分类效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05119 2025-12-08 cs.IR cs.AI cs.CL 73%

RAG-IGBench: Innovative Evaluation for RAG-based Interleaved Generation in Open-domain Question Answering

RAG-IGBench: 用于开放领域问答中基于检索增强生成的交错生成的创新评估

Rongyang Zhang, Yuqing Huang, Chengqiang Lu, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Yin Xu, Wei Wang, Hao Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Xiaohongshu Inc.(小红书公司) Xi’an Jiaotong University(西安交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RAG-IGBench通过创新的评估指标和多模态数据,评估基于检索增强生成的交错生成任务,验证了模型在开放领域问答中的性能提升。

Comments 26 pages, 6 figures, NeurIPS 2025 D&B Track poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05529 2025-12-08 cs.CV cs.AI 70%

See in Depth: Training-Free Surgical Scene Segmentation with Monocular Depth Priors

深入观察:基于单目深度先验的训练自由手术场景分割

Kunyi Yang, Qingyu Wang, Cheng Yuan, Yutong Ban

机构 * Global College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学全球学院)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出一种无需训练的手术场景分割方法,利用单目深度先验和预训练模型实现高效分割,实验表明其在标注效率和分割性能上优于现有方法。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05501 2025-12-08 cs.CL 70%

SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures

SEA-SafeguardBench: 评估SEA语言和文化中的AI安全

Panuthep Tasawong, Jian Gang Ngui, Alham Fikri Aji, Trevor Cohn, Peerat Limkonchotiwat

机构 * VISTEC Google(谷歌) AI Singapore(AI新加坡)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SEA-SafeguardBench是首个针对东南亚语言和文化的AI安全评估基准,通过八种语言21640个样本验证LLMs在文化特定危害场景下的表现。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11081 2025-12-08 cs.SE 67%

DPS: Design Pattern Summarisation Using Code Features

DPS:利用代码特征进行设计模式摘要

Najam Nazar, Sameer Sikka, Christoph Treude

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 DPS利用代码特征和JavaParser生成设计模式摘要,通过自然语言生成技术捕捉上下文信息,实验证明其摘要在ROUGE-L、BLEU-4等指标上表现优异,且在开发者理解时间上优于无摘要情况。

Comments 32 pages, 2 figures, 8 tables

Journal ref Empirical Software Engineering 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11984 2025-12-08 cs.DB 67%

NL2SQL-BUGs: A Benchmark for Detecting Semantic Errors in NL2SQL Translation

NL2SQL-BUGs: 一个用于检测NL2SQL翻译语义错误的基准

Xinyu Liu, Shuyu Shen, Boyan Li, Nan Tang, Yuyu Luo

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 NL2SQL-BUGs是一个用于检测NL2SQL翻译中语义错误的基准,通过两级分类法识别9大类31子类错误,揭示当前大语言模型在语义错误检测上的不足。

Comments 12 pages, 6 figures, 4 tables, KDD 2025

Journal ref SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05508 2025-12-08 cs.SD cs.AI cs.LG 62%

Lyrics Matter: Exploiting the Power of Learnt Representations for Music Popularity Prediction

歌词很重要:利用学习到的表示力预测音乐流行度

Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔) Department of Electrical Engineering, IIT Bombay(印度理工学院班加罗尔电气工程系) CFILT, Department of Computer Science, IIT Bombay(印度理工学院班加罗尔计算机科学系)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型提取歌词嵌入,结合音频和社交数据,提升音乐流行度预测精度,实验显示在SpotGenTrack数据集上MAE和MSE分别提升9%和20%。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05379 2025-12-08 cs.CL cs.AI 62%

Mitigating Self-Preference by Authorship Obfuscation

通过作者混淆缓解自我偏好

Taslim Mahbub, Shi Feng

机构 * Taslim Mahbub, Shi Feng

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过作者混淆技术减少语言模型判断者的自我偏好,发现简单词义替换可有效降低偏见,但彻底消除偏见面临根本挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05954 2025-12-08 cs.AI 57%

SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code

SymPyBench: 一个用于可执行Python代码科学推理的动态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 SymPyBench是一个用于科学推理的动态基准,通过可执行Python代码测试不同推理技能,提供新的评估指标以量化推理的不确定性和变化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05930 2025-12-08 cs.AI 57%

PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation

PRiSM:一种基于Python基础评估的科学推理多模态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 PRiSM通过基于Python代码的动态多模态基准,评估科学推理能力,揭示VLMs在科学领域中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05557 2025-12-08 cs.CV cs.AI 57%

2K-Characters-10K-Stories: A Quality-Gated Stylized Narrative Dataset with Disentangled Control and Sequence Consistency

2K角色-10K故事:一个具有解耦控制和序列一致性的质量门控风格化叙事数据集

Xingxi Yin, Yicheng Li, Gong Yan, Chenglin Li, Jian Zhao, Cong Huang, Yue Deng, Yin Zhang

机构 * Zhejiang University(浙江大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出2K-Characters-10K-Stories数据集,通过解耦控制和质量门控机制,实现高质量的风格化叙事生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04442 2025-12-08 cs.AI cs.SE 57%

TaskEval: Synthesised Evaluation for Foundation-Model Tasks

TaskEval: 基础模型任务的合成评估

Dilani Widanapathiranage, Scott Barnett, Stefanus Kurniawan, Wannita Takerngsaksiri

机构 * Applied Artificial Intelligence Initiative, Deakin University(应用人工智能倡议,德坎大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 TaskEval提出一种合成评估方法,通过任务无关的元模型、交互协议和评估合成器,为基础模型任务提供自动化评估和反馈收集,提升评估效率与准确性。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02738 2025-12-08 cs.CV 50%

Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning

Open-PMC-18M: 一种高保真大规模医学数据集用于多模态表示学习

Negin Baghbanzadeh, Mohammed Saidul Islam, Sajad Ashkezari, Elham Dolatabadi, Arash Afkanpour

机构 * Vector Institute(Vector研究所) York University(约克大学) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :language model(abstract)

AI总结 Open-PMC-18M通过高保真医学数据集提升多模态表示学习性能,实现子图提取与上下文丰富化,支持多种视觉-语言任务。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 23 篇

2402.01156 2025-12-08 cs.SE 89%

An Empirical Study on Low-Code Programming using Traditional vs Large Language Model Support

基于传统与大语言模型支持的低代码编程实证研究

Yongkun Liu, Jiachi Chen, Tingting Bi, John Grundy, Yanlin Wang, Jianxing Yu, Ting Chen, Yutian Tang, Zibin Zheng

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究通过实证分析比较了传统与基于大语言模型的低代码编程方法在应用中的差异及影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11315 2025-12-08 cs.CL cs.AI cs.CE 86%

LAET: A Layer-wise Adaptive Ensemble Tuning Framework for Pretrained Language Models

LAET: 一种用于预训练语言模型的分层自适应集成调优框架

Jawad Ibn Ahad, Muhammad Rafsan Kabir, Robin Krambroeckers, Sifat Momen, Nabeel Mohammed, Shafin Rahman

机构 * Artificial Intelligence Department, RobotBulls Labs(人工智能部门,RobotBulls实验室) Machine Intelligence Lab (MILab), North South University(机器智能实验室(MILab),北南大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 LAET提出了一种分层自适应集成调优框架,通过选择性微调预训练语言模型的关键层,以提高金融NLP任务的性能并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05498 2025-12-08 cs.SE 86%

A Hybrid Approach for EMF Code Generation:Code Templates Meet Large Language Models

一种混合方法用于EMF代码生成:代码模板与大型语言模型的结合

Xiao He, Ru Chen, Zeqing Zhang, Yanling Wang, Qiuyan Dong

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract)

AI总结 本文提出iEcoreGen,结合EMF和LLM,通过模板生成初始代码并利用LLM完善方法,提升代码生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05341 2025-12-08 cs.LG cs.AR 85%

When Forgetting Builds Reliability: LLM Unlearning for Reliable Hardware Code Generation

当遗忘构建可靠性:用于可靠硬件代码生成的LLM去学习

Yiwen Liang, Qiufeng Li, Shikai Wang, Weidong Cao

机构 * Department of ECE, The George Washington University(电子工程系,乔治·华盛顿大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种针对LLM硬件代码生成的去学习框架,通过语法保持策略和细粒度损失机制有效去除不良知识,提升代码生成的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09665 2025-12-08 cs.LG 85%

LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference

LMCache: 一种高效的键值缓存层用于企业级大语言模型推理

Yuhan Liu, Yihua Cheng, Jiayi Yao, Yuwei An, Xiaokun Chen, Shaoting Feng, Yuyang Huang, Samuel Shen, Rui Zhang, Kuntai Du, Junchen Jiang

机构 * Tensormesh Inc.(Tensormesh公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LMCache是一种高效的键值缓存解决方案,通过优化数据移动和模块化设计,提升大语言模型推理的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01472 2025-12-08 cs.LG 85%

LLM-NAS: LLM-driven Hardware-Aware Neural Architecture Search

LLM-NAS: 基于大语言模型的硬件感知神经架构搜索

Hengyi Zhu, Grace Li Zhang, Shaoyi Huang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LLM-NAS通过引入复杂度驱动的分区引擎、架构提示共进化操作符和零成本预测器,实现高精度低延迟的神经架构搜索,显著降低搜索成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05811 2025-12-08 cs.LG cs.AI 84%

MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling

MOSS:基于微缩和自动缩放的高效准确FP8大语言模型训练

Yu Zhang, Hui-Ling Zhen, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MOSS通过微缩和自动缩放技术,实现高效准确的FP8大语言模型训练,提升训练吞吐量34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05732 2025-12-08 cs.CL cs.AI 82%

Efficient Text Classification with Conformal In-Context Learning

高效文本分类中的符合性上下文学习

Ippokratis Pantelidis, Korbinian Randl, Aron Henriksson

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出CICLe框架,通过结合轻量级分类器与符合性预测,提升文本分类效率,减少样本和提示长度,尤其在高类别不平衡任务中表现优异。

Comments 10 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05409 2025-12-08 cs.CL 77%

SQ-format: A Unified Sparse-Quantized Hardware-friendly Data Format for LLMs

SQ-format: 一种统一的稀疏量化硬件友好数据格式用于大语言模型

Ruixuan Huang, Hao Zeng, Hantao Huang, Jinyuan Shi, Minghui Yu, Ian En-Hsu Yen, Shuai Wang

机构 * HKUST(香港科技大学) Moffett AI ByteDance Seed(字节跳动种子)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出SQ-format,一种统一的稀疏量化数据格式,旨在提升大语言模型在精度与效率之间的平衡,通过硬件友好设计实现性能与吞吐量的帕累托改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05403 2025-12-08 cs.LG 77%

RevoNAD: Reflective Evolutionary Exploration for Neural Architecture Design

RevoNAD:基于反射的进化探索用于神经架构设计

Gyusam Chang, Jeongyoon Yoon, Shin han yi, JaeHyeok Lee, Sujin Jang, Sangpil Kim

机构 * Korea University(韩国大学) Samsung AI Center(三星人工智能中心)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RevoNAD通过多轮多专家共识、自适应反射探索和帕累托引导的进化选择,实现了基于LLM的神经架构设计的高效优化与可靠生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05172 2025-12-08 cs.CV cs.AI 77%

Semore: VLM-guided Enhanced Semantic Motion Representations for Visual Reinforcement Learning

Semore:基于VLM的增强语义运动表示用于视觉强化学习

Wentao Wang, Chunyang Liu, Kehua Sheng, Bo Zhang, Yan Wang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Semore通过结合VLM和CLIP实现高效的视觉强化学习,提升语义和运动表示的融合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04996 2025-12-08 cs.LG cs.AI cs.CL stat.ML 75%

Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives

Reinforce-Ada: 非线性强化学习目标下的自适应采样框架

Wei Xiong, Chenlu Ye, Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian, Nan Jiang, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Reinforce-Ada通过自适应采样框架提升大语言模型在非线性强化学习目标下的推理性能,有效恢复丢失信号并加速收敛。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏