arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2601.18486 2026-03-24 cs.CL cs.CY 85%

Different Demographic Cues Yield Inconsistent Conclusions About LLM Personalization and Bias

不同的人口统计线索导致对LLM个性化和偏见的结论不一致

Manuel Tonneau, Neil K. R. Seghal, Niyati Malhotra, Sharif Kazemi, Victor Orozco-Olvera, Ana María Muñoz Boudet, Lakshmi Subramanian, Samuel P. Fraiberger, Sharath Chandra Guntuku, Valentin Hofmann

机构 * World Bank(世界银行) University of Oxford(牛津大学) New York University(纽约大学) University of Pennsylvania(宾夕法尼亚大学) LMU Munich(慕尼黑大学) Allen Institute for AI(人工智能研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过1480万个提示测试了人口统计线索对LLM响应的影响,发现同一群体的不同线索导致响应变化不一致,偏见结论不稳定,揭示了身份线索与语言信号的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20293 2026-03-24 cs.AI 85%

LLM-Enhanced Energy Contrastive Learning for Out-of-Distribution Detection in Text-Attributed Graphs

基于大语言模型的能量对比学习的文本属性图中分布外检测

Xiaoxu Ma, Dong Li, Minglai Shao, Xintao Wu, Chen Zhao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LECT方法,结合大语言模型和能量对比学习,在文本属性图中实现节点级分布外检测,提升分类准确性和鲁棒性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19668 2026-03-23 cs.CL 85%

Structured Prompting for Arabic Essay Proficiency: A Trait-Centric Evaluation Approach

结构化提示法在阿拉伯语作文能力评估中的应用:以特质为中心的评估方法

Salim Al Mandhari, Hieu Pham Dinh, Mo El-Haj, Paul Rayson

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种新的提示工程框架,用于阿拉伯语特质特定的自动作文评分,利用大语言模型在零样本和少样本配置下进行评估。通过三种层次提示策略,指导模型评估如组织、词汇、发展和风格等语言能力特质。实验表明,结构化提示法在阿拉伯语自动作文评分中效果显著。

Comments 13 pages

Journal ref The Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19333 2026-03-23 cs.AR cs.AI 85%

POET: Power-Oriented Evolutionary Tuning for LLM-Based RTL PPA Optimization

POET:面向LLM的RTL PPA优化的功率导向进化调优

Heng Ping, Peiyu Zhang, Zhenkun Wang, Shixuan Li, Anzhe Cheng, Wei Yang, Paul Bogdan, Shahin Nazarian

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 POET通过差分测试生成测试平台和LLM驱动的进化机制,在保证功能正确性的同时实现RTL PPA优化,取得100%正确性、最佳功耗和竞争力的面积延迟改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02768 2026-03-20 eess.AS cs.CL cs.SD 85%

DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment

DeSTA2.5-Audio:迈向通用大规模音频语言模型的自我生成跨模态对齐

Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Sung-Feng Huang, Chih-Kai Yang, Chee-En Yu, Chun-Wei Chen, Wei-Chih Chen, Chien-yu Huang, Yi-Cheng Lin, Yu-Xiang Lin, Chi-An Fu, Chun-Yi Kuan, Wenze Ren, Xuanjun Chen, Wei-Ping Huang, En-Pei Hu, Tzu-Quan Lin, Yuan-Kuei Wu, Kuan-Po Huang, Hsiao-Ying Huang, Huang-Cheng Chou, Kai-Wei Chang, Cheng-Han Chiang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出DeSTA2.5-Audio,一种通用大规模音频语言模型,通过自我生成的跨模态对齐策略解决知识保留与音频感知的平衡问题,展示了在多个音频-语言基准测试中的优异性能。

Comments Published in IEEE Transactions on Audio, Speech and Language Processing (TASLP). Model and code available at: https://github.com/kehanlu/DeSTA2.5-Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18171 2026-03-20 cs.CL 85%

Modeling the human lexicon under temperature variations: linguistic factors, diversity and typicality in LLM word associations

在温度变化下建模人类词汇库:LLM词关联中的语言因素、多样性与典型性

Maria Andueza Rodriguez, Marie Candito, Richard Huyghe

机构 * University of Fribourg(弗里堡大学) LLF (Université Paris Cité / CNRS)(LLF(巴黎Cité大学/国家科学研究中心)) Lucerne University of Applied Sciences and Arts(卢塞恩应用科学与艺术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过比较人类与LLM生成的词关联,探讨模型对人类词汇模式的捕捉准确性,发现大模型倾向于生成典型但变量小的响应,而小模型则更变量但典型性低,温度设置影响这一平衡。

Comments 11 pages, 12 figures, to appear in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17680 2026-03-19 cs.CV cs.AI 85%

WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models

WeatherReasonSeg:一种用于视觉语言模型中天气感知推理分割的基准测试

Wanjun Du, Zifeng Yuan, Tingting Chen, Fucai Ke, Beibei Lin, Shunli Zhang

机构 * Beijing Jiaotong University(北京交通大学) National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出WeatherReasonSeg基准测试,评估视觉语言模型在恶劣天气下的推理分割能力,通过合成和真实数据集分析天气对模型性能的影响,发现天气严重程度与模型性能呈单调下降关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17172 2026-03-19 cs.LG 85%

Noise-Response Calibration: A Causal Intervention Protocol for LLM-Judges

噪声响应校准:一种用于LLM判官的因果干预协议

Maxim Khomiakov, Jes Frellsen

机构 * Technical University of Denmark(丹麦技术大学) Normal Computing Corporation(Normal Computing公司) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于受控输入干预的校准协议,通过信号噪声比扰动和词法扰动评估LLM判官在不同模态下的表现,揭示了文本与表格数据在噪声下的差异行为。

Comments Published as a conference paper at CAO Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06396 2026-03-19 cs.AI cs.CR 85%

Efficient LLM Safety Evaluation through Multi-Agent Debate

通过多智能体辩论实现高效的LLM安全评估

Dachuan Lin, Guobin Shen, Zihao Yang, Tianrong Liu, Dongcheng Zhao, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Super Alignment(北京安全人工智能与超对齐重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) CSE, The Chinese University of Hong Kong(香港中文大学电子工程系) University of Chinese Academy of Sciences(中国科学院大学) Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) Long-term AI(长期人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多智能体辩论框架,利用HAJailBench基准测试,提升LLM安全评估的可靠性与经济性,验证了少量辩论轮次即可获得显著效果。

Comments 15 pages, 5 figures, 10 tables. Updated abstract to fix an incconsistency issue with the main paper: HAJailBench size (12,000 -> 11,100)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10204 2026-03-19 cs.SE cs.LG 85%

Code Roulette: How Prompt Variability Affects LLM Code Generation

代码掷骰子:提示变化如何影响LLM代码生成

Andrei Paleyes, Radzim Sendyka, Diana Robinson, Christian Cabrera, Neil D. Lawrence

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究探讨提示变化对LLM代码生成质量的影响,提出评估流程以量化模型对输入变化的敏感性,通过实验验证方法有效性。

Comments Extended version of the paper accepted to LLM4Code @ ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04893 2026-03-19 cs.CV cs.AI 85%

SCAM: A Real-World Typographic Robustness Evaluation for Multimodal Foundation Models

SCAM:多模态基础模型的现实世界字形鲁棒性评估

Justus Westerhoff, Erblina Purelku, Jakob Hackstein, Jonas Loos, Leo Pinetzki, Erik Rodner, Lorenz Hufe

机构 * BLISS e.V.(BLISS协会) Berliner Hochschule für Technik (BHT)(柏林技术大学) Technische Universität Berlin(柏林技术大学) KI Werkstatt, Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术经济学院) Merantix Momentum(Merantix Momentum公司) Fraunhofer Heinrich-Hertz-Institut, Berlin, Germany(柏林弗劳恩霍夫 Heinrich-Hertz 研究所)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SCAM数据集,用于评估多模态基础模型对字形攻击的鲁棒性,发现训练数据和模型架构影响攻击敏感性,且大语言模型基座可降低攻击影响。

Comments Accepted at CVPR 2025 Workshop EVAL-FoMo-2

Journal ref Journal of Data-centric Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16113 2026-03-18 cs.CV cs.AI 85%

PathGLS: Evaluating Pathology Vision-Language Models without Ground Truth through Multi-Dimensional Consistency

PathGLS: 通过多维一致性评估病理视觉-语言模型无需真实数据

Minbing Chen, Zhu Meng, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出PathGLS,一种无需真实数据的病理VLM评估框架,从 grounding、logic 和 stability 三个维度评估模型性能,通过实验验证其在多个数据集上的优越性,显著优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11408 2026-03-18 q-fin.ST cs.CL 85%

Beyond Polarity: Multi-Dimensional LLM Sentiment Signals for WTI Crude Oil Futures Return Prediction

超越极性:多维LLM情感信号用于WTI原油期货收益率预测

Dehao Dai, Ding Ma, Dou Liu, Kerui Geng, Yiqing Wang

机构 * University of California San Diego(加州大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) New York University(纽约大学) Tulane University(路易斯安那州立大学) Southern Methodist University(南方 Methodist 大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究多维情感信号对WTI原油期货收益率预测的提升作用,利用GPT-4o等模型提取五种情感维度,发现结合GPT-4o和FinBERT可获得最佳预测效果,证明情感信号超越单纯极性具有预测价值。

Comments 28 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13898 2026-03-18 cs.CL 85%

Attribution Quality in AI-Generated Content:Benchmarking Style Embeddings and LLM Judges

AI生成内容中的归因质量:基准测试风格嵌入与LLM裁判

Misam Abbas

机构 * IEEE International Conference on Data Mining Workshops(IEEE国际数据挖掘会议研讨会)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过Human AI Parallel Corpus评估风格嵌入与LLM裁判在AI生成内容归因中的表现,发现LLM裁判在小说和学术写作中表现更优,而嵌入在口语和剧本对话中更占优势,强调归因问题的多维性。

Comments Accepted for publication at the 2025 IEEE ICDM Workshop on "Grounding Documents with Reasoning, Agents, Retrieval, and Attribution". This is author submitted version. Not yet published

Journal ref Proc. IEEE Int. Conf. Data Mining Workshops (ICDMW), pp. 1713-1720, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15372 2026-03-17 cs.SE cs.AI cs.CR 85%

SKILLS: Structured Knowledge Injection for LLM-Driven Telecommunications Operations

SKILLS: 为基于LLM的电信运维进行结构化知识注入

Ivo Brett

机构 * independent.academia.edu(独立学术教育)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨LLM在电信运维中执行API流程的可靠性,提出SKILLS框架,通过结构化知识指导提升模型性能,实验显示技能增强效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15121 2026-03-17 cs.LG stat.ML 85%

Establishing Construct Validity in LLM Capability Benchmarks Requires Nomological Networks

在LLM能力基准中建立构念效度需要规范网络

Timo Freiesleben

机构 * Munich Center for Mathematical Philosophy(慕尼黑数学哲学中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了通过规范网络框架建立LLM能力基准的效度问题,指出该框架比因果和推断框架更适合当前研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22680 2026-03-17 cs.AI 85%

Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions

迈向个性化大语言模型驱动的代理:基础、评估与未来方向

Yue Xu, Qian Chen, Zizhan Ma, Dongrui Liu, Wenxuan Wang, Xiting Wang, Li Xiong, Wenjie Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨个性化LLM代理的基础、评估及未来方向,分析了四个核心能力:用户画像建模、记忆、规划与行动执行,并总结了评估指标和应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21071 2026-03-17 cs.HC cs.AI 85%

FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents

FingerTip 20K: 一个用于主动和个性化移动大语言模型代理的基准测试

Qinglong Yang, Haoming Li, Haotian Zhao, Xiaokai Yan, Jingtao Ding, Fengli Xu, Yong Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出FingerTip 20K基准测试,通过收集20000个真实用户多步骤Android交互演示,评估主动任务建议和个性化任务执行的挑战,展示基于用户信息的移动LLM代理的潜力。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02569 2026-03-17 cs.CR cs.AI 85%

DECEIVE-AFC: Adversarial Claim Attacks against Search-Enabled LLM-based Fact-Checking Systems

DECEIVE-AFC:针对具有搜索功能的基于大语言模型的事实核查系统的对抗性声明攻击

Haoran Ou, Kangjie Chen, Gelei Deng, Hangcheng Liu, Jie Zhang, Tianwei Zhang, Kwok-Yan Lam

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DECEIVE-AFC框架,通过新型声明级攻击策略和对抗性声明有效性评估原则,研究对抗性声明攻击对基于大语言模型的事实核查系统的影响,实验表明攻击显著降低验证性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13189 2026-03-16 cs.MA cs.AI 85%

LLM Constitutional Multi-Agent Governance

大语言模型宪法多智能体治理

J. de Curtò, I. de Zarzà

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CMAG框架,通过硬约束过滤与软惩罚效用优化,在多智能体群体中平衡合作潜力与操纵风险,实验显示CMAG在保持自主性和完整性的同时提升了合作的伦理得分。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12872 2026-03-16 cs.CL 85%

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

CLARIN-PT-LDB: 一个开放的大型语言模型排行榜用于葡萄牙语以评估语言、文化与礼貌

João Silva, Luís Gomes, António Branco

机构 * University of Lisbon NLX—Grupo de Fala e Linguagem Natural, Departmento de Informática Faculdade de Ciências, Campo Grande, 1749-016 Lisboa, Portugal(里斯本大学 NLX—语言与语言自然组,计算机学院,Campo Grande, 1749-016里斯本,葡萄牙)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了CLARIN-PT-LDB,一个用于评估欧洲葡萄牙语大型语言模型的开放排行榜,填补了该语言模型评估的空白,并引入了新的基准测试,包括模型安全性和对葡萄牙文化的对齐性。

Comments Accepted at PROPOR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11955 2026-03-13 cs.CL 85%

PersonaTrace: Synthesizing Realistic Digital Footprints with LLM Agents

PersonaTrace: 基于LLM代理的数字足迹合成

Minjia Wang, Yunfeng Wang, Xiao Ma, Dexin Lv, Qifan Guo, Lynn Zheng, Benliang Wang, Lei Wang, Jiannan Li, Yongwei Xing, David Xu, Zheng Sun

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PersonaTrace通过LLM代理生成多样且逼真的数字足迹,提升数据集的多样性和真实性,从而增强模型在真实任务中的表现。

Comments EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03782 2026-03-12 cond-mat.supr-con cond-mat.str-el cs.AI 85%

Expert Evaluation of LLM World Models: A High-$T_c$ Superconductivity Case Study

专家评估LLM世界模型:一个高温超导体案例研究

Haoyu Guo, Maria Tikhanovskaya, Paul Raccuglia, Alexey Vlaskin, Chris Co, Daniel J. Liebling, Scott Ellsworth, Matthew Abraham, Elizabeth Dorfman, N. P. Armitage, Chunhan Feng, Antoine Georges, Olivier Gingras, Dominik Kiese, Steven A. Kivelson, Vadim Oganesyan, B. J. Ramshaw, Subir Sachdev, T. Senthil, J. M. Tranquada, Michael P. Brenner, Subhashini Venugopalan, Eun-Ah Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过专家评估LLM在高温超导领域的问题回答能力,发现基于RAG的系统在全面性和证据支持方面优于封闭模型。

Comments (v1) 9 pages, 4 figures, with 7-page supporting information. Accepted at the ICML 2025 workshop on Assessing World Models and the Explorations in AI Today workshop at ICML'25

Journal ref Proceedings of the National Academy of Sciences 123, e2533676123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08999 2026-03-11 cs.CR cs.AI 85%

MCP Bridge: A Lightweight, LLM-Agnostic RESTful Proxy for Model Context Protocol Servers

MCP Bridge:一种轻量级、LLM无关的RESTful代理,用于模型上下文协议服务器

Arash Ahmadi, Sarah Sharif, Yaser M. Banad

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCP Bridge是一种轻量级RESTful代理,通过统一API连接多个MCP服务器,支持任意后端,提升安全性和跨平台兼容性,优化模型在MCPToolBench++上取得73.0%的F1分数。

Comments 42 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07460 2026-03-10 cs.CR cs.AI 85%

Where Do LLM-based Systems Break? A System-Level Security Framework for Risk Assessment and Treatment

LLM-based系统在哪里失效?一个系统级安全框架用于风险评估与处理

Neha Nagaraja, Hayretdin Bahsi

机构 * Northern Arizona University(北亚利桑那大学) Department of Software Science(软件科学系) Tallinn University of Technology(塔林技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种系统级安全框架,用于评估和处理LLM系统中的风险,通过结合系统建模与攻击-防御树,分析医疗场景中的多步骤攻击路径,并提供可比较的防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07360 2026-03-10 cs.AI 85%

The Yerkes-Dodson Curve for AI Agents: Emergent Cooperation Under Environmental Pressure in Multi-Agent LLM Simulations

人工智能代理的耶克斯-多森曲线:多代理大语言模型模拟中的环境压力下的自发合作

Ivan Pasichnyk

机构 * WeLabelData Inc.(WeLabelData公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过多代理大语言模型模拟,发现环境压力与合作行为呈倒U型关系,揭示了压力校准在AI代理开发中的重要性。

Comments 13 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05689 2026-03-09 cs.CR cs.AI 85%

SecureRAG-RTL: A Retrieval-Augmented, Multi-Agent, Zero-Shot LLM-Driven Framework for Hardware Vulnerability Detection

SecureRAG-RTL: 一种基于检索增强的多智能体零样本LLM驱动框架用于硬件漏洞检测

Touseef Hasan, Blessing Airehenbuwa, Nitin Pundir, Souvika Sarkar, Ujjwal Guin

机构 * School of Computing, Wichita State University(计算机科学学院,威斯康星州立大学) Department of Electrical and Computer Engineering, Auburn University(电气与计算机工程系,阿伯茨兰大学) IBM

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SecureRAG-RTL通过检索增强生成方法提升硬件漏洞检测准确率,实现30%的性能提升并公开基准数据集支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05520 2026-03-09 cs.MA cs.CR cs.LG 85%

Information-Theoretic Privacy Control for Sequential Multi-Agent LLM Systems

信息论视角下的序列多智能体大语言模型系统隐私控制

Sadia Asif, Mohammad Mohammadi Amiri

机构 * Department of Computer Science, Rensselaer Polytechnic Institute, Troy New York(计算机科学系,雷士拉尔理工大学,特洛伊新 York)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出了一种信息论视角下的隐私控制框架,用于解决序列多智能体LLM系统中因信息流而产生的隐私泄露问题,通过约束信息流实现隐私与效用的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04992 2026-03-09 cs.CL 85%

ThaiSafetyBench: Assessing Language Model Safety in Thai Cultural Contexts

ThaiSafetyBench: 评估泰语文化背景下语言模型的安全性

Trapoom Ukarapol, Nut Chukamphaeng, Kunat Pipatanakul, Pakhapoom Sarapat

机构 * SCB DataX(SCB数据X) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) SCBX R&D(SCBX研发部) SCB 10X

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本研究提出ThaiSafetyBench,通过泰语文化背景下的恶意提示评估语言模型安全性,发现闭源模型安全性更强,同时揭示了文化特定攻击的高风险。

Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04417 2026-03-06 cs.CL 85%

Same Input, Different Scores: A Multi Model Study on the Inconsistency of LLM Judge

相同输入,不同评分:多模型研究LLM裁判的一致性

Fiona Lau

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了LLM在不同模型、温度设置下对相同输入评分的一致性问题,发现模型间评分差异显著,温度影响稳定性,需引入混合评估策略以确保可靠应用。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏