arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-04 至 2026-02-04 共收录 299 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 51 篇

2602.03114 2026-02-04 cs.CY cs.AI 77%

Digital Lifelong Learning in the Age of AI: Trends and Insights

人工智能时代下的数字终身学习:趋势与洞察

Geeta Puri, Nachamma Socklingam, Dorien Herremans

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨人工智能时代下数字学习的发展趋势,分析不同人群对数字学习平台的互动,揭示疫情后数字学习相关性提升的原因,并为教育和企业优化学习服务提供策略建议。

Comments 41 pages including references, appendix, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03557 2026-02-04 cs.SE 75%

Scaling Test-Driven Code Generation from Functions to Classes: An Empirical Study

从函数到类的测试驱动代码生成规模化:一项实证研究

Yunhao Liang, Ruixuan Ying, Shiwen Ni, Zhe Cui

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种测试驱动代码生成框架,通过迭代方法提升类级代码生成的正确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03183 2026-02-04 cs.CL cs.AI 73%

Privasis: Synthesizing the Largest "Public" Private Dataset from Scratch

Privasis:从零开始合成最大的“公共”私有数据集

Hyunwoo Kim, Niloofar Mireshghallah, Michael Duan, Rui Xin, Shuyue Stella Li, Jaehun Jung, David Acuna, Qi Pang, Hanshen Xiao, G. Edward Suh, Sewoong Oh, Yulia Tsvetkov, Pang Wei Koh, Yejin Choi

机构 * NVIDIA CMU(卡内基梅隆大学) USC(南加州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Privasis是首个从零开始构建的百万级合成数据集,用于提升隐私敏感领域研究的规模和效率,其模型在隐私净化任务中表现优异。

Comments For code and data, see https://privasis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03263 2026-02-04 cs.AI 70%

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02774 2026-02-04 cs.CL 70%

AmharicStoryQA: A Multicultural Story Question Answering Benchmark in Amharic

阿姆哈拉语故事问答基准:阿姆哈拉语多文化故事问答基准

Israel Abebe Azime, Abenezer Kebede Angamo, Hana Mekonen Tamiru, Dagnachew Mekonnen Marilign, Philipp Slusallek, Seid Muhie Yimam, Dietrich Klakow

机构 * Saarland University(萨尔兰大学) AIMS AMMI Resonance AI4D Lab(Resonance AI4D实验室) Addis Ababa University(亚的斯亚贝巴大学) HILCOE School of Computer Science and Technology(HILCOE计算机科学与技术学院) University of Hamburg(汉堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AmharicStoryQA基准,通过多文化叙事揭示现有LLMs在叙事理解上的不足,强调文化差异对语言评估的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02604 2026-02-04 econ.EM cs.AI 70%

AI Assisted Economics Measurement From Survey: Evidence from Public Employee Pension Choice

基于调查的AI辅助经济学测量:来自公共员工养老金选择的证据

Tiancheng Wang, Krishna Sharma

机构 * Hoover Institution, Stanford University(霍夫曼研究所,斯坦福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于AI的迭代框架,用于从调查中提取经济测量结构,通过软映射和有效性测试优化分类法,揭示养老金选择中的行为信号与经济机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03056 2026-02-04 cs.IR 67%

ALPBench: A Benchmark for Attribution-level Long-term Personal Behavior Understanding

ALPBench:一种用于属性级长期个人行为理解的基准测试

Lu Ren, Junda She, Xinchen Luo, Tao Wang, Xin Ye, Xu Zhang, Muxuan Wang, Xiao Yang, Chenguang Wang, Fei Xie, Yiwei Zhou, Danjun Wu, Guodong Zhang, Yifei Hu, Guoying Zheng, Shujie Yang, Xingmei Wang, Shiyao Wang, Yukun Zhou, Fan Yang, Size Li, Kuo Cai, Qiang Luo, Ruiming Tang, Han Li, Kun Gai

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 ALPBench是一种用于属性级长期个人行为理解的基准测试,通过预测用户感兴趣的属性组合,实现对个性化推荐的细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03652 2026-02-04 cs.CL cs.AI cs.IR 62%

RAGTurk: Best Practices for Retrieval Augmented Generation in Turkish

RAGTurk:土耳其语中检索增强生成的最佳实践

Süha Kağan Köse, Mehmet Can Baytekin, Burak Aktaş, Bilge Kaan Görür, Evren Ayberk Munis, Deniz Yılmaz, Muhammed Yusuf Kartal, Çağrı Toraman

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 RAGTurk研究了土耳其语中检索增强生成的最佳实践,通过构建土耳其RAG数据集并测试RAG管道各阶段,发现HyDE方法在准确性上表现最佳,同时帕累托最优配置在成本较低的情况下也表现出色。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03338 2026-02-04 cs.CL cs.LG 62%

Accurate Failure Prediction in Agents Does Not Imply Effective Failure Prevention

代理中准确的失败预测并不意味着有效的失败预防

Rakshith Vasudev, Melisa Russak, Dan Bikel, Waseem Alshikh

机构 * Writer, Inc.(作家公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究发现LLM批评模型的高准确度并不保证安全干预,提出预部署测试以判断干预是否有益,避免部署前的严重性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02551 2026-02-04 cs.LG cs.AI cs.CV 62%

EEO-TFV: Escape-Explore Optimizer for Web-Scale Time-Series Forecasting and Vision Analysis

EEO-TFV:面向网络级时间序列预测和视觉分析的逃逸-探索优化器

Hua Wang, Jinghao Lu, Fan Zhang

机构 * School of Computer and Artificial Intelligence, Ludong University(计算机与人工智能学院,鲁东大学) School of Computer Science and Technology, Shandong Technology and Business University(计算机科学与技术学院,山东技术与商务大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 EEO-TFV通过轻量级Transformer架构与逃逸-探索优化器,提升网络级时间序列预测和视觉分析的性能与泛化能力。

Comments Main paper: 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17736 2026-02-04 cs.CV cs.AI cs.CL 62%

V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction

V2P-Bench: 通过视觉提示评估视频语言理解以提升人机交互

Yiming Zhao, Yu Zeng, Yukun Qi, YaoYang Liu, Xikun Bao, Lin Chen, Zehui Chen, Qing Miao, Chenxi Liu, Jie Zhao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Xi’an Jiaotong University(西安交通大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 V2P-Bench通过视觉提示评估视频语言理解,提升人机交互效率与体验,揭示模型在时空理解上的不足及Hack现象。

Comments Project Page: https://vlm-reasoning.github.io/V2P-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03587 2026-02-04 cs.CL 57%

CL-bench: A Benchmark for Context Learning

CL-bench: 一个用于上下文学习的基准测试

Shihan Dou, Ming Zhang, Zhangyue Yin, Chenhao Huang, Yujiong Shen, Junzhe Wang, Jiayi Chen, Yuchen Ni, Junjie Ye, Cheng Zhang, Huaibing Xie, Jianglu Hu, Shaolei Wang, Weichao Wang, Yanling Xiao, Yiting Liu, Zenan Xu, Zhen Guo, Pluto Zhou, Tao Gui, Zuxuan Wu, Xipeng Qiu, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Di Wang, Shunyu Yao

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 CL-bench是一个用于评估上下文学习能力的基准测试,通过复杂任务和上下文设计,揭示当前语言模型在真实任务中的学习瓶颈。

Comments 78 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14661 2026-02-04 cs.DB cs.AI 57%

Abacus: A Cost-Based Optimizer for Semantic Operator Systems

Abacus:一种基于成本的语义运算系统优化器

Matthew Russo, Chunwei Liu, Sivaprasad Sudhir, Gerardo Vitagliano, Michael Cafarella, Tim Kraska, Samuel Madden

机构 * MIT(麻省理工学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 Abacus是一种基于成本的优化器,用于优化语义运算系统,通过评估运算符性能并优化系统质量、成本和延迟,实现更高效的文档处理任务。

Comments To be published in VLDB'26, 14 pages, 8 figures

Journal ref PVLDB, 19(5): 1060 - 1073, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03255 2026-02-04 cs.AI 57%

LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios

LPS-Bench: 在长周期规划中评估计算机使用代理的安全意识基准测试

Tianyu Chen, Chujia Hu, Ge Gao, Dongrui Liu, Xia Hu, Wenjie Wang

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 LPS-Bench通过评估长周期规划中计算机使用代理的安全意识,揭示现有系统在安全行为维持方面的不足,并提出缓解策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01590 2026-02-04 cs.CL 57%

Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles

Wiki Live Challenge: 用专家级维基百科文章挑战深度研究代理

Shaohan Wang, Benfeng Xu, Licheng Zhang, Mingxuan Du, Chiwei Zhu, Xiaorui Wang, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 Wiki Live Challenge通过专家级维基百科文章挑战深度研究代理,提出Wiki Eval框架以评估其写作质量和事实准确性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11698 2026-02-04 cs.LG 57%

Moirai 2.0: When Less Is More for Time Series Forecasting

Moirai 2.0:在时间序列预测中,少即是多

Chenghao Liu, Taha Aksu, Juncheng Liu, Xu Liu, Hanshu Yan, Quang Pham, Silvio Savarese, Doyen Sahoo, Caiming Xiong, Junnan Li

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 Moirai 2.0通过简化架构和分位数损失提升时间序列预测的准确性和效率,同时在模型大小和速度上优于前代版本。

Comments 16 pages, 13 figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03416 2026-02-04 cs.IR 50%

AesRec: A Dataset for Aesthetics-Aligned Clothing Outfit Recommendation

AesRec:一个用于美学对齐的服装搭配推荐数据集

Wenxin Ye, Lin Li, Ming Li, Yang Shen, Kanghong Wang, Jimmy Xiangji Huang

专题命中 评测与基准 :language model(abstract)

AI总结 AesRec数据集通过系统化的定量美学注释,为开发与美学对齐的服装推荐系统提供了支持,实验表明整合量化美学信息能提升用户审美指导与个性化需求的满足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE 50%

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

专题命中 评测与基准 :language model(abstract)

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 73 篇

2602.02896 2026-02-04 cs.SE 91%

Failure-Aware Enhancements for Large Language Model (LLM) Code Generation: An Empirical Study on Decision Framework

面向大语言模型(LLM)代码生成的失败意识增强:决策框架的实证研究

Jianru Shen, Zedong Peng, Lucy Owen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(title);prompting(abstract)

AI总结 本文通过实证研究,提出了一种基于失败特征的决策框架,用于指导大语言模型代码生成中的增强策略选择。

Comments Accepted at SANER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03632 2026-02-04 cs.SE 90%

CALM: A Self-Adaptive Orchestration Approach for QoS-Aware Routing in Small Language Model based Systems

CALM:一种面向服务质量的自适应协调方法,用于基于小型语言模型的系统中路由

Hemang Jain, Divyansh Pandey, Karthik Vaidhyanathan

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 CALM通过自适应协调机制优化小型语言模型路由,降低延迟和能耗,提升服务质量

Comments Accepted as full paper at SEAMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03035 2026-02-04 cs.CR cs.LG 89%

Generalizable and Interpretable RF Fingerprinting with Shapelet-Enhanced Large Language Models

可推广且可解释的基于形状let的大型语言模型在射频指纹中的应用

Tianya Zhao, Junqing Zhang, Haowen Xu, Xiaoyan Sun, Jun Dai, Xuyu Wang

机构 * Florida International University(佛罗里达国际大学) University of Liverpool(利物浦大学) Worcester Polytechnic Institute(沃斯特理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出了一种结合形状let和预训练LLM的框架,用于实现高效、可解释且可推广的射频指纹识别,通过捕捉局部时间模式和全局上下文信息,提升跨领域性能。

Comments 12 pages, 7 figures, IMWUT submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03815 2026-02-04 cs.CV cs.LG 88%

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

通过视觉标记修剪实现多模态大语言模型的快慢高效训练

Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 DualSpeed通过快慢双模式实现多模态大语言模型的高效训练,提升训练速度并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03750 2026-02-04 cs.CV cs.AI 88%

Zero-shot large vision-language model prompting for automated bone identification in paleoradiology x-ray archives

零样本大视觉语言模型提示法用于古放射学x光档案中骨骼自动识别

Owen Dong, Lily Gao, Manish Kota, Bennett A. Landmana, Jelena Bekvalac, Gaynor Western, Katherine D. Van Schaik

专题命中 效率与部署 :language model(title,abstract);prompting(title,abstract);分类 cs.AI

AI总结 利用大视觉语言模型实现古放射学x光图像中骨骼自动识别,提升内容导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02501 2026-02-04 cs.LG cs.CR 88%

Augmenting Parameter-Efficient Pre-trained Language Models with Large Language Models

通过大语言模型增强参数高效预训练语言模型

Saurabh Anand, Shubham Malaviya, Manish Shukla, Sachin Lodha

机构 * TCS Research(TCS研究)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出通过大语言模型增强参数高效预训练语言模型,以提高网络安全领域模型的可靠性与鲁棒性。

Comments 22 pages, 9 figures, 11 tables, short paper was accepted in ACM SAC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02848 2026-02-04 cs.LG 87%

Zero Sum SVD: Balancing Loss Sensitivity for Low Rank LLM Compression

零和SVD:平衡损失敏感性以实现低秩LLM压缩

Ali Abbasi, Chayne Thrash, Haoran Qin, Shansita Sharma, Sepehr Seifi, Soheil Kolouri

机构 * Department of Computer Science, Vanderbilt University, TN, USA(计算机科学系,范德比尔特大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 零和SVD通过全局奇异成分选择和零和规则实现低秩LLM压缩,无需优化即可自动生成异质秩,提升压缩效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02522 2026-02-04 cs.LG cs.AI 87%

IMU-1: Sample-Efficient Pre-training of Small Language Models

IMU-1: 小语言模型的样本高效预训练

George Grigorev

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :language model(title,abstract);small language model(title);分类 cs.AI、cs.LG

AI总结 IMU-1通过高效预训练方法,在少量数据上实现接近大规模数据训练的性能,展示了小语言模型的高效训练潜力。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03359 2026-02-04 cs.LG cs.AI cs.CL 87%

MeKi: Memory-based Expert Knowledge Injection for Efficient LLM Scaling

MeKi:基于记忆的专家知识注入用于高效的LLM扩展

Ning Ding, Fangcheng Liu, Kyungrae Kim, Linji Hao, Kyeng-Hun Lee, Hyeonmok Ko, Yehui Tang

机构 * Samsung Research(三星研究)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MeKi通过利用存储空间而非计算量扩展LLM容量,实现边缘设备上的高效推理,验证了基于内存的扩展方法在设备端LLM中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02891 2026-02-04 cs.LG cs.CL 86%

TraceNAS: Zero-shot LLM Pruning via Gradient Trace Correlation

TraceNAS: 通过梯度轨迹相关性实现零样本LLM剪枝

Prajna G. Malettira, Manish Nagaraj, Arjun Roy, Shubham Negi, Kaushik Roy

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 TraceNAS通过梯度轨迹相关性实现零样本LLM剪枝,高效发现高保真剪枝模型,减少GPU计算成本并提升模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02760 2026-02-04 cs.CL cs.LG 86%

From Task Solving to Robust Real-World Adaptation in LLM Agents

从任务解决到在LLM代理中的鲁棒现实适应

Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加戈恩实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM代理在现实环境中的鲁棒适应能力,发现任务解决与实际部署鲁棒性存在显著差距,揭示了在部分可观测性和噪声环境下代理的决策挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02538 2026-02-04 cs.LG cs.CL cs.CV 86%

Enhancing Post-Training Quantization via Future Activation Awareness

通过未来激活意识增强后训练量化

Zheqi Lv, Zhenxuan Fan, Qi Tian, Wenqiao Zhang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过利用未来层激活信息,提出Future-Aware Quantization方法,有效提升后训练量化效果,适用于边缘部署。

详情

展开后加载摘要…

URL PDF HTML 收藏