arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-26 至 2025-11-26 共收录 191 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 49 篇

2511.19477 2025-11-26 cs.SE 75%

Building Browser Agents: Architecture, Security, and Practical Solutions

构建浏览器代理:架构、安全与实用解决方案

Aram Vardanyan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过专用工具和编程约束构建安全浏览器代理,实现85%的成功率。

Comments 30 pages, 22 figures. Production architecture and benchmark evaluation of browser agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20296 2025-11-26 cs.CV cs.AI 74%

Prompting Lipschitz-constrained network for multiple-in-one sparse-view CT reconstruction

通过提示的Lipschitz约束网络实现多视角稀疏视图CT重建

Baoshun Shi, Ke Jiang, Qiusheng Lian, Xinran Yu, Huazhu Fu

机构 * School of Information Science and Engineering, Yanshan University(燕山大学信息科学与工程学院) Beijing Advanced Innovation Center for Imaging Technology, Capital Normal University(北京影像技术先进创新中心,首都师范大学) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所(IHPC),科技研究局(A*STAR))

专题命中 评测与基准 :prompting(title);分类 cs.AI

AI总结 本文提出LipNet和PromptCT框架,通过显式证明的Lipschitz约束网络和提示模块,实现多视角稀疏视图CT重建的高质量与低存储成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20513 2025-11-26 cs.CV cs.AI cs.CL cs.HC 73%

DesignPref: Capturing Personal Preferences in Visual Design Generation

DesignPref: 在视觉设计生成中捕捉个人偏好

Yi-Hao Peng, Jeffrey P. Bigham, Jason Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DesignPref通过引入包含20名专业设计师多级评分的12,000对UI设计比较数据集,研究个性化视觉设计评估,展示个性化模型在预测个体偏好上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20459 2025-11-26 cs.CL cs.AI 73%

Generation, Evaluation, and Explanation of Novelists' Styles with Single-Token Prompts

用单个标记提示生成、评估和解释小说家的风格

Mosab Rezaei, Mina Rajaei Moghadam, Abdul Rahman Shaikh, Hamed Alhoori, Reva Freedman

机构 * Department of Computer Science Northern Illinois University(计算机科学系北伊利诺伊大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过单个标记提示生成并评估19世纪小说家的风格,利用变压器检测器和可解释AI方法分析文本风格特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19798 2025-11-26 cs.AI cs.HC cs.LG cs.MA 73%

KOM: A Multi-Agent Artificial Intelligence System for Precision Management of Knee Osteoarthritis (KOA)

KOM:一种用于膝骨关节炎(KOA)精准管理的多智能体人工智能系统

Weizhi Liu, Xi Chen, Zekun Jiang, Liang Zhao, Kunyuan Jiang, Ruisi Tang, Li Wang, Mingke You, Hanyu Zhou, Hongyu Chen, Qiankun Xiong, Yong Nie, Kang Li, Jian Li

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 KOM通过多智能体系统实现膝骨关节炎的自动化评估与管理,提升诊疗效率和个性化治疗质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20547 2025-11-26 cs.CL 70%

From Words to Wisdom: Discourse Annotation and Baseline Models for Student Dialogue Understanding

从词语到智慧:学生对话理解的语篇标注与基线模型

Farjana Sultana Mim, Shuchin Aeron, Eric Miller, Kristen Wendell

机构 * Department of Electrical and Computer Engineering, Tufts University(电气与计算机工程系,塔夫茨大学) Department of Computer Science and Information Technology, Patuakhali Science and Technology University(计算机科学与信息技术系,帕图阿哈利科学与技术大学) Department of Electrical and Computer Engineering, Computer Science and Biomedical Engineering, Tufts University(电气与计算机工程系,计算机科学与生物医学工程系,塔夫茨大学) Department of Mechanical Engineering and Education, Tufts University(机械工程与教育系,塔夫茨大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个标注的教育对话数据集和基于预训练模型的基线模型,用于自动检测学生对话中的语篇特征,发现现有模型在该任务上表现欠佳,提示未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20526 2025-11-26 cs.AI 70%

Assessing LLMs' Performance: Insights from the Chinese Pharmacist Exam

评估大语言模型的性能:来自中国药师资格考试的洞察

Xinran Wang, Boran Zhu, Shujuan Zhou, Ziwen Long, Dehua Zhou, Shu Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究比较了DeepSeek-R1和ChatGPT-4o在药师资格考试中的表现,发现DeepSeek-R1在准确性上显著优于后者,强调了领域特定模型在评估中的重要性及人类监督的必要性。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19481 2025-11-26 cs.LG 70%

Quality analysis and evaluation prediction of RAG retrieval based on machine learning algorithms

基于机器学习算法的RAG检索质量分析与评估预测

Ruoxin Zhang, Zhizhao Wen, Chao Wang, Chenchen Tang, Puyang Xu, Yifan Jiang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于XGBoost和粒子群优化的模型,通过分析文档相关性与答案质量的正相关性,改进RAG系统的检索质量与生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06250 2025-11-26 cs.CV cs.AI cs.HC 70%

Generative AI for Cel-Animation: A Survey

生成式AI用于动画:一种调查

Yolo Y. Tang, Junjia Guo, Pinxin Liu, Zhiyuan Wang, Hang Hua, Jia-Xing Zhong, Yunzhong Xiao, Chao Huang, Luchuan Song, Susan Liang, Yizhi Song, Liu He, Jing Bi, Mingqian Feng, Xinyang Li, Zeliang Zhang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) UCSB University of Oxford(牛津大学) CMU(卡内基梅隆大学) Purdue University(普渡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文调查生成式AI如何通过自动化任务革新传统动画流程,降低技术门槛,扩大创作者群体,并促进艺术创新。

Comments Accepted by ICCV 2025 AISTORY Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10979 2025-11-26 cs.CV cs.AI 70%

VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?

VidComposition: MLLMs能否分析编译视频中的构成?

Yolo Y. Tang, Junjia Guo, Hang Hua, Susan Liang, Mingqian Feng, Xinyang Li, Rui Mao, Chao Huang, Jing Bi, Zeliang Zhang, Pooyan Fazli, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VidComposition通过编排视频和电影级注释评估MLLMs对视频构成的理解能力,揭示了当前模型在复杂编译视频分析中的局限性。

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16334 2025-11-26 cs.CV 67%

Panoptic Captioning: An Equivalence Bridge for Image and Text

全景描述:图像与文本之间的等价桥梁

Kun-Yu Lin, Hongjun Wang, Weining Ren, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出全景描述任务,通过PancapEngine和PancapChain方法提升图像与文本的等价描述能力,实验表明其优于现有大语言模型。

Comments NeurIPS 2025; Project page: https://visual-ai.github.io/pancap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14421 2025-11-26 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

ExDDV: A New Dataset for Explainable Deepfake Detection in Video

ExDDV:用于视频可解释深度伪造检测的新数据集

Vlad Hondru, Eduard Hogea, Darian Onchis, Radu Tudor Ionescu

机构 * University of Bucharest(布加勒斯大学) West University of Timişoara(蒂米什瓦拉西大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ExDDV通过引入文本和点击监督,开发出可解释的深度伪造检测模型,以提高视频中深度伪造内容的识别能力。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17177 2025-11-26 cs.CL cs.CV cs.LG 66%

FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions

FlagEval Findings Report: 对大推理模型在自动可验证文本和视觉问题上的初步评估

Bowen Qin, Chen Yue, Fang Yin, Hui Wang, JG Yao, Jiakang Liu, Jing-Shu Zheng, Miguel Hu Chen, Richeng Xuan, Shibei Meng, Shiqi Zhou, Teng Dai, Tong-Shuai Ren, Wei Cui, Xi Yang, Xialin Du, Xiaojing Xu, Xue Sun, Xuejing Li, Yaming Liu, Yesheng Liu, Ying Liu, Yonghua Lin, Yu Zhao, Yunduo Zhang, Yuwen Luo, Zheqi He, Zhiyuan He, Zhongyuan Wang

机构 * BAAI FlagEval Team(百度人工智能研究院FlagEval团队) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) Peking University(北京大学)

专题命中 评测与基准 :language model(abstract,comments);分类 cs.CL、cs.LG

AI总结 FlagEval报告对大推理模型在自动可验证文本和视觉问题上的初步评估进行了研究,提出了ROME基准以测试视觉线索推理能力。

Comments Project homepage: https://flageval-baai.github.io/LRM-Eval/ This work will also be presented at NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM); update with trials on Gemini 3 Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19841 2025-11-26 cs.LG cs.AI stat.ML 62%

Cisco Time Series Model Technical Report

思科时间序列模型技术报告

Liang Gou, Archit Khare, Praneet Pabolu, Prachi Patel, Joseph Ross, Hercy Shen, Yuhan, Song, Jingze Sun, Kristal Curtis, Vedant Dharnidharka, Abhinav Mathur, Hao Yang

机构 * Cisco(思科)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 思科提出一种多分辨率时间序列模型,通过改进解码器结构,实现对多分辨率输入的处理,提升长上下文预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20067 2025-11-26 cs.AI cs.HC 57%

"Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents

我们完成了吗?

Marta Sumyk, Oleksandr Kosovan

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于视觉的评估机制,通过视觉-语言模型评估计算机使用代理的任务完成情况,提升了任务完成的准确性和可靠性。

Comments This work has been accepted to appear at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19980 2025-11-26 cs.LG cs.NA math.NA 57%

Operator Learning at Machine Precision

在机器精度下实现运算符学习

Aras Bacho, Aleksei G. Sorokin, Xianjin Yang, Théo Bourdais, Edoardo Calvello, Matthieu Darcy, Alexander Hsu, Bamdad Hosseini, Houman Owhadi

机构 * Department of Computing and Mathematical Sciences, California Institute of Technology(加州理工学院计算与数学科学部) Department of Applied Mathematics, Illinois Institute of Technology(伊利诺伊理工学院应用数学系) Department of Applied Mathematics, University of Washington(华盛顿大学应用数学系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出CHONKNORIS和FONKNORIS模型,通过Cholesky因子回归实现非线性PDE的高精度求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20218 2025-11-26 cs.CV 50%

Text-guided Controllable Diffusion for Realistic Camouflage Images Generation

基于文本引导的可控扩散生成逼真伪装图像

Yuhang Qian, Haiyan Chen, Wentong Li, Ningzhong Liu, Jie Qin

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出CT-CIG方法,通过文本引导和可控扩散生成逼真且逻辑合理的伪装图像,利用VLM和FIRM模块提升伪装图像质量。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20169 2025-11-26 cs.CV 50%

ADNet: A Large-Scale and Extensible Multi-Domain Benchmark for Anomaly Detection Across 380 Real-World Categories

ADNet: 一个大规模且可扩展的多领域异常检测基准,涵盖380个现实世界类别

Hai Ling, Jia Guo, Zhulin Tao, Yunkang Cao, Donglin Di, Hongyan Xu, Xiu Su, Yang Song, Lei Fan

机构 * Communication University of China(中国通信大学) DZ Matrix(DZ矩阵) Tsinghua University(清华大学) Hunan University(湖南大学) Central South University(中南大学) UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 评测与基准 :foundation model(abstract)

AI总结 ADNet是一个大规模多领域异常检测基准,涵盖380个现实世界类别,通过多模态数据支持异常检测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19836 2025-11-26 cs.CV 50%

4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models

4DWorldBench: 一种用于3D/4D世界生成模型的综合评估框架

Yiting Lu, Wei Luo, Peiyan Tu, Haoran Li, Hanxin Zhu, Zihao Yu, Xingrui Wang, Xinyi Chen, Xinge Peng, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院)

专题命中 评测与基准 :LLM(abstract)

AI总结 4DWorldBench提出了一种用于评估3D/4D世界生成模型的综合框架,通过四个维度评估模型的感知质量、条件对齐、物理真实性和一致性,支持多模态输入并整合多种评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19200 2025-11-26 cs.CV 50%

Can Modern Vision Models Understand the Difference Between an Object and a Look-alike?

现代视觉模型能否理解物体与相似物之间的差异?

Itay Cohen, Ethan Fetaya, Amir Rosenfeld

专题命中 评测与基准 :language model(abstract)

AI总结 本文研究了现代视觉模型能否区分真实物体与相似物,通过构建RoLA数据集并改进CLIP模型的嵌入空间方向,提升跨模态检索和描述生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14337 2025-11-26 cs.HC 50%

MobileViews: A Million-scale and Diverse Mobile GUI Dataset

MobileViews: 一个百万级且多样化的移动GUI数据集

Longxi Gao, Li Zhang, Shihe Wang, Pengzhi Gao, Wei Liu, Jian Luan, Shangguang Wang, Yuanchun Li, Mengwei Xu

专题命中 评测与基准 :language model(abstract)

AI总结 MobileViews是一个百万级移动GUI数据集,通过大规模高保真数据提升GUI定位精度,公开可用。

Comments Dataset: https://huggingface.co/datasets/mllmTeam/MobileViews

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 35 篇

2410.13334 2025-11-26 cs.CL cs.AI cs.LG 90%

BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models

BiasJailbreak: 分析大型语言模型中的伦理偏见和 jailbreak 漏洞

Isack Lee, Haebin Seong

机构 * Theori Inc.(Theori公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分析了大型语言模型中的伦理偏见和 jailbreak 漏洞,提出 BiasJailbreak 和 BiasDefense 方法以提高模型安全性。

Comments Accepted as a workshop paper at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19495 2025-11-26 cs.LG cs.AI 88%

A Systematic Study of Compression Ordering for Large Language Models

大语言模型压缩顺序的系统研究

Shivansh Chhawri, Rahul Mahadik, Suparna Rooj

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究系统探讨了大语言模型压缩技术的顺序对性能的影响,发现剪枝-知识蒸馏-量化顺序能实现3.68倍压缩并保持良好能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19648 2025-11-26 cs.CL cs.AI 86%

Efficient Multi-Hop Question Answering over Knowledge Graphs via LLM Planning and Embedding-Guided Search

通过LLM规划和嵌入引导搜索实现高效的多跳知识图谱问答

Manil Shrestha, Edward Kim

机构 * Department of Computer Science, Drexel University, Philadelphia, PA, USA(计算机科学系,德雷塞尔大学,费城,宾夕法尼亚州,美国)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出两种混合算法,通过LLM规划和嵌入引导搜索实现高效且可验证的多跳知识图谱问答,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19496 2025-11-26 cs.LG cs.AI 86%

Xmodel-2.5: 1.3B Data-Efficient Reasoning SLM

Xmodel-2.5: 1.3B数据高效推理SLM

Yang Liu, Xiaolong Zhong, Ling Jiang

机构 * Xiaoduo AI Lab(小多人工智能实验室)

专题命中 效率与部署 :SLM(title);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 Xmodel-2.5通过最大更新参数化和混合精度训练,实现了1.3B参数高效推理模型,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15815 2025-11-26 cs.AI 85%

Attention Pruning: Automated Fairness Repair of Language Models via Surrogate Simulated Annealing

注意力剪枝:通过代理模拟退火实现语言模型的自动公平性修复

Vishnu Asutosh Dasu, Md Rafi ur Rashid, Vipul Gupta, Saeid Tizpaz-Niari, Gang Tan

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Illinois(伊利诺伊大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出注意力剪枝方法,通过代理模拟退火在LLMs中减少偏见,提升公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19483 2025-11-26 cs.SE cs.AI 85%

Z-Space: A Multi-Agent Tool Orchestration Framework for Enterprise-Grade LLM Automation

Z-Space:面向企业级LLM自动化的一种多智能体工具协调框架

Qingsong He, Jing Nan, Jiayu Jiao, Liangjie Tang, Xiaodong Xu, Mengmeng Sun, Qingyao Wang, Minghui Yan

机构 * Rajax Network Technology (ele.me)(Rajax网络技术(ele.me))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Z-Space通过多智能体协作框架提升企业级LLM自动化工具调用效率与准确性

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14909 2025-11-26 cs.LG cs.AI cs.CL 85%

Mixture of Attention Spans: Optimizing LLM Inference Efficiency with Heterogeneous Sliding-Window Lengths

注意力跨度混合:通过异质滑动窗口长度优化LLM推理效率

Tianyu Fu, Haofeng Huang, Xuefei Ning, Genghan Zhang, Boju Chen, Tianqi Wu, Hongyi Wang, Zixiao Huang, Shiyao Li, Shengen Yan, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence-AI Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MoA通过异质滑动窗口长度优化LLM推理效率,提升上下文长度和检索准确率,减少内存消耗并提高吞吐量。

Comments Published at CoLM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19523 2025-11-26 cs.CR 85%

EAGER: Edge-Aligned LLM Defense for Robust, Efficient, and Accurate Cybersecurity Question Answering

EAGER: 边缘对齐的LLM防御方法用于鲁棒、高效且准确的网络安全问答

Onat Gungor, Roshan Sood, Jiasheng Zhou, Tajana Rosing

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 EAGER通过参数高效量化与领域偏好对齐,提升网络安全问答的鲁棒性、效率和准确性,降低对抗攻击成功率并优化响应延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18428 2025-11-26 cs.AI cs.CL 84%

Multi-Modal Data Exploration via Language Agents

通过语言代理进行多模态数据探索

Farhad Nooralahzadeh, Yi Zhang, Jonathan Furst, Kurt Stockinger

机构 * Zurich University of Applied Sciences(瑞士应用科学大学)

专题命中 效率与部署 :language agent(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M$^2$EX系统,通过语言代理实现多模态数据探索,优于现有系统在准确性和性能指标上

Comments Accepted to the IJCNLP AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏