arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 88 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 88 篇

2601.06193 2026-01-13 cs.LG cs.AI cs.CL 91%

MLB: A Scenario-Driven Benchmark for Evaluating Large Language Models in Clinical Applications

MLB:面向临床应用的大型语言模型评估场景驱动基准

Qing He, Dongsheng Bi, Jianrong Lu, Minghui Yang, Zixiao Chen, Jiacheng Lu, Jing Chen, Nannan Du, Xiao Cu, Sijing Wu, Peng Xiang, Yinyin Hu, Yi Guo, Chunpu Li, Shaoyang Li, Zhuo Dong, Ming Jiang, Shuai Guo, Liyun Feng, Jin Peng, Jian Wang, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Health Information Center of Zhejiang Province(浙江省健康信息中心) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。

Comments 11 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07153 2026-01-13 cs.CL cs.AI 90%

Can Large Language Models Understand, Reason About, and Generate Code-Switched Text?

大语言模型能否理解、推理并生成混合语言文本?

Genta Indra Winata, David Anugraha, Patrick Amadeus Irawan, Anirban Das, Haneul Yoo, Paresh Dashore, Shreyas Kulkarni, Ruochen Zhang, Haruki Sakajo, Frederikus Hudi, Anaelia Ovalle, Syrielle Montariol, Felix Gaschi, Michael Anugraha, Rutuj Ravindra Puranik, Zawad Hayat Ahmed, Adril Putra Merin, Emmanuele Chersoni

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过CodeMixQA基准测试评估大语言模型在理解、推理和生成混合语言文本方面的能力,揭示了模型在混合语言环境中的局限性,并提供了改进多语言LLMs的见解。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06937 2026-01-13 cs.AI cs.LG 90%

mind_call: A Dataset for Mental Health Function Calling with Large Language Models

mind_call: 一个用于大语言模型心理健康新功能调用的数据集

Fozle Rabbi Shafi, M. Anwar Hossain, Salimur Choudhury

机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10662 2026-01-13 cs.CL cs.AI 90%

Evaluation of the Automated Labeling Method for Taxonomic Nomenclature Through Prompt-Optimized Large Language Model

通过提示优化的大型语言模型评估自动标注方法在分类学命名中的应用

Keito Inoshita, Kota Nojiri, Haruto Sugeno, Takumi Taga

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过提示优化的大型语言模型评估了自动标注方法在分类学命名中的可行性,发现其在形态、地理和人名类别中表现良好,但在生态与行为及文化背景类别中存在挑战。

Comments This paper was accepted by IEEE IAICT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04031 2026-01-13 astro-ph.IM astro-ph.HE cs.AI 89%

Large Language Models for Limited Noisy Data: A Gravitational Wave Identification Study

针对有限噪声数据的大型语言模型:引力波识别研究

Yixuan Li, Yuhao Lu, Yang Liu, Liang Li, R. Ruffini, Di Li, Rong-Gen Cai, Xiaoyan Zhu, Wenbin Lin, Yu Wang

机构 * Institute of Fundamental Physics and Quantum Technology(基础物理与量子技术研究所) School of Physical Science and Technology(物理科学与技术学院) School of Mathematics and Physics(数学与物理学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究通过引力波识别实验表明,大型语言模型在有限噪声和标注数据下能高效提取结构,优于传统神经网络。

Comments 10 pages, 5 figures, submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07278 2026-01-13 cs.AI 89%

Lifelong Learning of Large Language Model based Agents: A Roadmap

基于大语言模型代理的终身学习:路线图

Junhao Zheng, Chengming Shi, Xidi Cai, Qiuke Li, Duzhen Zhang, Chenxing Li, Dong Yu, Qianli Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型代理的终身学习框架,通过三个模块整合多模态输入、知识存储与动态环境交互,以实现持续适应和长期性能提升。

Comments Accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07290 2026-01-13 cs.CV 89%

VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding

VideoLoom:一种用于联合空间-时间理解的视频大语言模型

Jiapeng Shi, Junke Wang, Zuyao You, Bo He, Zuxuan Wu

机构 * Fudan University(复旦大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02533 2026-01-13 cs.SE 89%

Meta-Fair: AI-Assisted Fairness Testing of Large Language Models

Meta-Fair: 大型语言模型的AI辅助公平性测试

Miguel Romero-Arjona, José A. Parejo, Juan C. Alonso, Ana B. Sánchez, Aitor Arrieta, Sergio Segura

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 Meta-Fair通过元测试法和LLM能力,实现大型语言模型的自动化公平性测试,揭示偏见并提高评估一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14408 2026-01-13 cs.CL cs.AI 88%

From Implicit to Explicit: Enhancing Self-Recognition in Large Language Models

从隐式到显式:提升大语言模型的自我认知能力

Yinghan Zhou, Weifeng Zhu, Juan Wen, Wanli Peng, Zhengxian Wu, Yiming Xue

机构 * College of Information and Electrical Engineering, China Agricultural University(信息与电气工程学院,中国农业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoSur框架,通过改进大语言模型的隐式自我认知能力,在个体呈现范式下提升其自我识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06757 2026-01-13 cs.CL cs.AI 88%

MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues

MTMCS-Bench: 多轮对话中多模态大语言模型上下文安全性的评估

Zheyuan Liu, Dongwhi Kim, Yixin Wan, Xiangchi Yuan, Zhaoxuan Tan, Fengran Mo, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Georgia Institute of Technology(佐治亚理工学院) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MTMCS-Bench评估多模态大语言模型在多轮对话中的上下文安全性,揭示了安全与效用之间的权衡及现有防护措施的不足。

Comments A benchmark of realistic images and multi-turn conversations that evaluates contextual safety in MLLMs under two complementary settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06042 2026-01-13 cs.LG cs.CL 88%

CrossTrafficLLM: A Human-Centric Framework for Interpretable Traffic Intelligence via Large Language Model

CrossTrafficLLM: 一种面向人类的基于大语言模型的可解释交通智能框架

Zeming Du, Qitan Shao, Hongfei Liu, Yong Zhang

机构 * Beijing Key Laboratory of Multimedia and Intelligent Software Technology(北京多媒体与智能软件技术重点实验室) Beijing Artificial Intelligence Institute(北京人工智能研究院) Faculty of Information Technology(信息科技学院) Beijing University of Technology(北京工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 CrossTrafficLLM通过结合大语言模型与图卷积网络,实现交通预测与自然语言生成的统一,提升交通智能的可解释性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06944 2026-01-13 cs.CV cs.AI 88%

SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models

SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准

Yuhang Su, Mei Wang, Yaoyao Zhong, Guozhang Li, Shixing Li, Yihan Feng, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。

Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06118 2026-01-13 cs.AI 88%

Beyond Reproducibility: Token Probabilities Expose Large Language Model Nondeterminism

超越可重复性:令牌概率揭示大语言模型非确定性

Tairan Fu, Gonzalo Martínez, Javier Conde, Carlos Arriaga, Pedro Reviriego, Xiuyuan Qi, Shanshan Liu

机构 * Politecnico di Milano(米兰理工学院) Information Processing and Telecommunications Center ETSI de Telecomunicación, Universidad Politécnica de Madrid(信息处理与电信中心,马德里理工大学) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了大语言模型在非确定性下的令牌概率变化,发现非确定性对生成文本的影响显著,且可通过单次推理分析令牌概率来估计其影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06088 2026-01-13 q-fin.ST cs.LG 88%

PriceSeer: Evaluating Large Language Models in Real-Time Stock Prediction

PriceSeer:实时股票预测中大型语言模型的评估

Bohan Liang, Zijian Chen, Qi Jia, Kaiwei Zhang, Kaiyuan Ji, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 PriceSeer通过实时动态数据评估LLMs在股票预测中的性能,提供数据无污染的基准测试及六种先进模型的多时间范围预测分析。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06341 2026-01-13 cs.LG cs.AI cs.SE 87%

Evaluating Robustness of Large Language Models in Enterprise Applications: Benchmarks for Perturbation Consistency Across Formats and Languages

评估大型语言模型在企业应用中的鲁棒性:跨格式和语言的扰动一致性基准测试

Tara Bogavelli, Oluwanifemi Bamgbose, Gabrielle Gauthier Melançon, Fanny Riols, Roshnee Sharma

机构 * ServiceNow

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出跨格式和语言的扰动一致性基准测试,评估大型语言模型在企业应用中的鲁棒性,发现模型大小与鲁棒性关系复杂,8B参数模型表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06213 2026-01-13 cs.CR cs.AI cs.LG cs.SE 87%

Cyber Threat Detection and Vulnerability Assessment System using Generative AI and Large Language Model

基于生成式人工智能和大语言模型的网络威胁检测与漏洞评估系统

Keerthi Kumar. M, Swarun Kumar Joginpelly, Sunil Khemka, Lakshmi. S R, Navin Chhibber

专题命中 评测与基准 :large language model(title);language model(title);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于RoBERTa模型的网络威胁检测系统,通过加密数据和生成令牌提升检测准确率,优于传统BERT模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06884 2026-01-13 cs.CL cs.AI cs.LG 87%

Paraphrasing Adversarial Attack on LLM-as-a-Reviewer

对LLM-as-a-Reviewer的改写对抗攻击

Masahiro Kaneko

机构 * MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种针对LLM作为评审员的改写对抗攻击方法,通过优化生成改写序列以提高评审评分,同时保持语义和语言自然性,并验证了其有效性及潜在的检测信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06596 2026-01-13 cs.CR cs.AI 86%

Are LLMs Vulnerable to Preference-Undermining Attacks (PUA)? A Factorial Analysis Methodology for Diagnosing the Trade-off between Preference Alignment and Real-World Validity

大型语言模型是否易受偏好削弱攻击(PUA)攻击?一种诊断偏好对齐与现实有效性之间权衡的因子分析方法

Hongjun An, Yiliang Song, Jiangan Chen, Jiawei Shao, Chi Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics, Northwestern Polytechnical University(人工智能学院、光学与电子学院、西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) School of Economics and Management, Guangxi Normal University(经济管理学院,广西师范大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种因子分析方法,用于诊断LLM在偏好对齐与现实有效性之间的权衡,揭示了高级模型可能更易受操纵性提示攻击,并强调了定制防御的重要性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07309 2026-01-13 cs.AI cs.LG 86%

ARM: Role-Conditioned Neuron Transplantation for Training-Free Generalist LLM Agent Merging

ARM:基于角色的神经元移植用于无训练通用大语言模型代理融合

Zhuoka Feng, Kang Chen, Sihan Zhao, Kai Xiong, Yaoning Wang, Minshen Yu, Junjie Nian, Changyi Xiao, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ARM通过角色条件神经元移植方法提升大语言模型代理在多环境中的泛化能力,实现无训练的模型融合。

Comments 17 pages, 12 figures. Project page: https://arkazhuo.github.io/ARM-homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05623 2026-01-13 cs.SE cs.AI cs.CL 86%

Deployability-Centric Infrastructure-as-Code Generation: Fail, Learn, Refine, and Succeed through LLM-Empowered DevOps Simulation

以部署为中心的基础设施即代码生成:通过LLM赋能的DevOps模拟实现失败、学习、细化和成功

Tianyi Zhang, Shidong Pan, Zejun Zhang, Zhenchang Xing, Xiaoyu Sun

机构 * Australian National University Canberra Australia New York University \& Columbia University USA Nanyang Technological University Singapore Australian National University Australia Australian National University New York University \& Columbia University Nanyang Technological University

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IaCGen框架,通过迭代反馈机制提升IaC模板的部署性,实验表明其在10次迭代内可使模板部署成功率提升至91.6%,并进一步通过人工反馈将性能提升至90%以上。

Comments Accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14268 2026-01-13 cs.CL cs.AI 86%

Think-J: Learning to Think for Generative LLM-as-a-Judge

Think-J: 生成式大语言模型作为评判者的学习思考

Hui Huang, Yancheng He, Hongli Zhou, Rui Zhang, Wei Liu, Weixun Wang, Jiaheng Liu, Wenbo Su

机构 * \dagger(机构2)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Think-J通过学习思考方式提升生成式LLM作为评判者的性能,利用强化学习优化判断轨迹,无需额外标注即可超越现有方法。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07504 2026-01-13 cs.LG cs.SE 85%

FROAV: A Framework for RAG Observation and Agent Verification -- Lowering the Barrier to LLM Agent Research

FROAV:一个用于RAG观察和代理验证的框架——降低LLM代理研究的门槛

Tzu-Hsuan Lin, Chih-Hsuan Kao

机构 * AetheTech

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FROAV提供了一个开源平台,通过可视化工作流编排、评估框架和Python集成,降低LLM代理研究的门槛,使研究人员能更专注于算法创新。

Comments 8 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07206 2026-01-13 cs.AI 85%

LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing

LLMRouterBench: 一个大规模基准和统一框架用于LLM路由

Hao Li, Yiqun Zhang, Zhaoyan Guo, Chenxu Wang, Shengji Tang, Qiaosheng Zhang, Yang Chen, Biqing Qi, Peng Ye, Lei Bai, Zhen Wang, Shuyue Hu

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LLMRouterBench通过大规模基准和统一框架评估LLM路由方法,揭示了模型互补性、性能-成本权衡及路由方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06301 2026-01-13 cs.CR cs.AI cs.SE 85%

Beyond BeautifulSoup: Benchmarking LLM-Powered Web Scraping for Everyday Users

超越BeautifulSoup:为日常用户评估基于LLM的网络爬虫基准测试

Arth Bhardwaj, Nirav Diwan, Gang Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了基于LLM的网络爬虫在日常用户中的应用,展示了端到端LLM代理如何使复杂爬虫变得简单,同时比较了LLM辅助脚本和端到端代理在不同场景下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06216 2026-01-13 cs.CY cs.AI 85%

LLM Agents in Law: Taxonomy, Applications, and Challenges

法律中的LLM代理:分类、应用与挑战

Shuang Liu, Ruijia Zhang, Ruoyun Ma, Yujia Deng, Lanyi Zhu, Jiayu Li, Zelong Li, Zhibin Shen, Mengnan Du

机构 * Carnegie Mellon University(卡内基梅隆大学) National University of Singapore(国立新加坡大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) The University of Chicago(芝加哥大学) Rutgers University(罗格斯大学) Columbia University(哥伦比亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了法律领域中LLM代理的分类、应用及挑战,分析了技术转变、应用分类、评估方法及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07063 2026-01-13 cs.AI 85%

Towards Safer AI Moderation: Evaluating LLM Moderators Through a Unified Benchmark Dataset and Advocating a Human-First Approach

迈向更安全的AI审核:通过统一基准数据集评估LLM审核员并倡导以人类为中心的方法

Naseem Machlovi, Maryam Saleki, Innocent Ababio, Ruhul Amin

机构 * Fordham University(福特汉姆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过统一基准数据集评估LLM审核性能,提出SafePhi在道德判断上优于现有模型,强调需引入人类反馈提升审核可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06838 2026-01-13 cs.CR cs.SE 85%

CHASE: LLM Agents for Dissecting Malicious PyPI Packages

CHASE:用于拆解恶意PyPI包的LLM代理

Takaaki Toda, Tatsuya Mori

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 CHASE通过多代理架构提升恶意PyPI包检测的可靠性,实现高召回率与低误报率。

Comments Accepted for publication and presented at the 2nd IEEE International Conference on AI-powered Software (AIware 2025). 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06141 2026-01-13 cs.CY 85%

An LLM -Powered Assessment Retrieval-Augmented Generation (RAG) For Higher Education

基于大语言模型的评估检索增强生成(RAG)系统用于高等教育

Reza Vatankhah Barenji, Nazila Salimi, Sina Khoshgoftar

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出基于RAG架构的大语言模型驱动评估系统,通过整合评分标准和范文生成高质量反馈,实现大规模、一致的评估反馈,提升学生自主学习能力。

Comments 19 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13772 2026-01-13 cs.SD cs.AI cs.LG cs.MM eess.AS 84%

Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models

Jailbreak-AudioBench: 对大型音频语言模型中 jailbreak 威胁的深入评估与分析

Hao Cheng, Erjia Xiao, Jing Shao, Yichi Wang, Le Yang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学) Beijing University of Technology(北京理工大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 Jailbreak-AudioBench 通过构建工具箱、数据集和基准,深入评估大型音频语言模型中 jailbreak 威胁,并促进安全防护机制的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06845 2026-01-13 cs.AI 83%

Code Evolution for Control: Synthesizing Policies via LLM-Driven Evolutionary Search

代码进化用于控制:通过LLM驱动的进化搜索合成策略

Ping Guo, Chao Li, Yinglan Feng, Chaoning Zhang

机构 * Shenzhen Yuyi Tech. Co. Ltd.(深圳优衣科技有限公司) City University of Hong Kong(香港城市大学) Shenzhen University(深圳大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :LLM(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出利用LLM驱动的进化搜索生成可解释的控制策略,通过代码进化方法合成可执行代码,提升自主系统控制策略的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏