arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2603.26544 2026-03-30 cs.CL q-bio.QM 57%

Development of a European Union Time-Indexed Reference Dataset for Assessing the Performance of Signal Detection Methods in Pharmacovigilance using a Large Language Model

欧盟时间索引参考数据集的开发:利用大型语言模型评估药监信号检测方法性能

Maria Kefala, Jeffery L. Painter, Syed Tauhid Bukhari, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) GSK(葛兰素史克)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文开发了欧盟时间索引参考数据集,利用大型语言模型识别药品不良反应,以评估信号检测方法的性能,填补了药监领域的时间信息缺失空白。

Comments 4 Figures and 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25870 2026-03-30 cs.CV cs.LG 57%

Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations

通过VLM驱动的结构化绘图表示实现语音同步的白板生成

Suraj Prasad, Pinak Mahapatra

机构 * Latent Spaces IITB(印度理工学院孟买分校潜在空间实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出首个包含24对Excalidraw演示与叙述音频的白板数据集,研究基于Qwen2-VL-7B模型通过时间戳条件化实现语音同步的绘图预测,验证了模型在跨学科领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16629 2026-03-30 cs.CV cs.AI 57%

MLLM-based Textual Explanations for Face Comparison

基于MLLM的文本解释用于面部比较

Redwan Sony, Anil K Jain, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文研究了MLLM在无约束面部验证任务中生成解释的可靠性,发现其解释常依赖不可验证的面部属性,并提出基于似然比的框架评估解释可信度。

Comments Accepted at 14th International Workshop on Biometrics and Forensics (IWBF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25727 2026-03-27 cs.AI cs.MM 57%

Back to Basics: Revisiting ASR in the Age of Voice Agents

回归基础:在语音助手时代重新审视ASR

Geeyang Tay, Wentao Ma, Jaewon Lee, Yuzhi Tang, Daniel Lee, Weisu Yin, Dongming Shen, Silin Meng, Yi Zhu, Mu Li, Alex Smola

机构 * Boson AI

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究指出现有ASR系统在真实场景下表现不佳,提出多语言诊断基准WildASR,揭示模型在环境退化、人口变化和语言多样性下的性能退化问题,并提供分析工具提升可靠性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25178 2026-03-27 cs.CV cs.CL 57%

Bilingual Text-to-Motion Generation: A New Benchmark and Baselines

双语文本到动作生成:一个新的基准和基线

Wanjiang Weng, Xiaofeng Tan, Xiangbo Shu, Guo-Sen Xie, Pan Zhou, Hongsong Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) Nanjing University of Science and Technology(南京理工大学) Singapore Management University(新加坡管理大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出BiHumanML3D双语文本到动作基准及BiMD基线,通过跨语言对齐策略提升多语言动作生成质量,实验显示其在FID和R@3指标上显著优于单语模型和翻译基线。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18840 2026-03-27 cs.CV cs.CL 57%

See the Text: From Tokenization to Visual Reading

查看文本:从分词到视觉阅读

Ling Xing, Rui Yan, Alex Jinpeng Wang, Zechao Li, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学技术与人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出SeeTok方法,通过将文本渲染为图像并利用预训练多模态大模型实现视觉阅读,相比传统子词分词在资源消耗和跨语言泛化方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11413 2026-03-27 cs.HC cs.AI 57%

Evaluation format, not model capability, drives triage failure in the assessment of consumer health AI

评估格式而非模型能力驱动消费者健康AI的分诊失败

David Fraile Navarro, Farah Magrabi, Enrico Coiera

机构 * Centre for Health Informatics(健康信息学中心) Australian Institute of Health Innovation(澳大利亚健康创新研究所) Macquarie University(麦考瑞大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究通过对比考试式与自然场景下的分诊测试,发现评估格式显著影响分诊准确性,指出消费者健康AI的评估需模拟真实使用场景以获得可靠结果。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20001 2026-03-26 cs.CL cs.SI 57%

A Machine Learning Approach for Detection of Mental Health Conditions and Cyberbullying from Social Media

从社交媒体检测心理健康状况和网络欺凌的一种机器学习方法

Edward Ajayi, Martha Kachweka, Mawuli Deku, Emily Aiken

机构 * Carnegie Mellon University Africa Kigali, Rwanda(卡内基梅隆大学非洲分校基加利分校,刚果(金))

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出统一的多类分类框架,用于从社交媒体数据中检测十种不同的心理健康和网络欺凌类别,通过实验表明端到端微调对性能至关重要,MentalBERT模型在准确率和宏F1分数上表现优异。

Comments Best Paper Award at the AAAI-26 Bridge Program on AI for Medicine and Healthcare. Published in Proceedings of the Second AAAI Bridge Program on AI for Medicine and Healthcare, PMLR 317:15-26, 2026. Paper URL: https://proceedings.mlr.press/v317/ajayi26a.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16501 2026-03-26 cs.AI 57%

Learning To Guide Human Decision Makers With Vision-Language Models

通过视觉-语言模型引导人类决策者

Debodeep Banerjee, Stefano Teso, Burcu Sayin, Andrea Passerini

机构 * DI, University of Pisa(比萨大学DI) DISI, University of Trento(特伦托大学DISI) CIMEC, University of Trento(特伦托大学CIMEC) Rajib Pal Bankura Sammilani Medical College(拉吉布·帕尔班克尔医学学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出LTG框架,通过视觉-语言模型生成可解释的决策指导,使人类负责最终决策,提升高风险场景下的决策质量与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24073 2026-03-26 cs.CL 57%

ConceptKT: A Benchmark for Concept-Level Deficiency Prediction in Knowledge Tracing

ConceptKT:一种用于知识追踪中概念层面缺陷预测的基准

Yu-Chen Kang, Yu-Chien Tang, An-Zi Yen

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出ConceptKT基准,通过标注问题所需概念和错误响应下的缺失概念,评估大语言模型和推理模型在概念层面缺陷预测中的性能。

Comments Accepted by LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23527 2026-03-26 cs.CL 57%

Compression Method Matters: Benchmark-Dependent Output Dynamics in LLM Prompt Compression

压缩方法至关重要:在LLM提示压缩中的基准依赖性输出动态

Warren Johnson

机构 * Plexor Labs(Plexor实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究探讨了提示压缩对输出长度和推理成本的影响,提出指令生存概率指标,并揭示了不同基准下的压缩效果差异,强调提示结构对压缩安全性和效率的重要性。

Comments 19 pages. Includes figures and tables. Companion code/data repository and direct NVML calibration dataset are cited in manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23479 2026-03-26 cs.CL 57%

FHIRPath-QA: Executable Question Answering over FHIR Electronic Health Records

FHIRPath-QA:基于FHIR电子健康记录的可执行问答

Michael Frew, Nishit Bheda, Bryan Tripp

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出FHIRPath-QA,首个支持患者特定问题的开放数据集和基准,通过将推理转向FHIRPath查询合成,提升问答效率与准确性,验证了其在临床应用中的潜力。

Comments Accepted to LREC 2026 CL4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11733 2026-03-26 cs.MA cs.AI 57%

SafeSieve: From Heuristics to Experience in Progressive Pruning for LLM-based Multi-Agent Communication

SafeSieve: 从启发式到经验在基于大语言模型的多智能体通信中的渐进剪枝

Ruijia Zhang, Xinyan Zhao, Ruixiang Wang, Sigen Chen, Guibin Zhang, An Zhang, Kun Wang, Qingsong Wen

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出SafeSieve,一种渐进适应的多智能体剪枝算法,通过双重机制动态优化智能体间通信。实验显示其在多个基准上实现了高准确率并显著降低token使用量,同时在异构环境下保持性能。

Comments AAAI-2026 poster; 7 pages for main content, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23308 2026-03-25 cs.CV cs.AI 57%

Curriculum-Driven 3D CT Report Generation via Language-Free Visual Grafting and Zone-Constrained Compression

基于课程学习的3D CT报告生成:通过无语言视觉移植与区域约束压缩

V. K. Cody Bumgardner, Mitchell A. Klusty, Mahmut S. Gokmen, Evan W. Damron

机构 * Center for Applied Artificial Intelligence, University of Kentucky(应用人工智能中心,肯塔基大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出Ker-VLJEPA-3B框架,通过四阶段课程学习生成胸腔CT报告,采用无语言视觉主干和区域约束压缩提升生成质量,实验显示其在CT-RATE基准上取得更高F1分数。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15994 2026-03-25 cs.CR cs.AI 57%

MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents

MCP安全基准(MSB):针对LLM代理中模型上下文协议的攻击评估

Dongsen Zhang, Zekun Li, Xu Luo, Xuannan Liu, Peipei Li, Wenjun Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出MSB,首个端到端评估套件,系统评估LLM代理在MCP全流程中的抗攻击能力,包含12种攻击类型及性能指标NRP,评估九种主流LLM代理在10个领域405种工具上的表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22777 2026-03-25 cs.AI 57%

AgriPestDatabase-v1.0: A Structured Insect Dataset for Training Agricultural Large Language Model

AgriPestDatabase-v1.0:用于训练农业大语言模型的结构化昆虫数据集

Yagizhan Bilal Durak, Ahsan Ul Islam, Shahidul Islam, Ashley Morgan-Olvera, Iftekhar Ibne Basith, Syed Hasib Akhter Faruqui

机构 * Sam Houston State University(萨姆豪斯敦州立大学) Kennesaw State University(肯纳威克州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出AgriPestDatabase-v1.0,构建了结构化昆虫数据集并采用轻量级LLM进行微调,以提升农业害虫管理的决策支持能力。

Comments Accepted in Artificial Super Intelligence Conference 2026 (Sponsored by KSU PLOT & IEEE CIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23276 2026-03-25 cs.AI 57%

CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays

CXReasonAgent:基于证据的胸部X光诊断推理代理

Hyungyung Lee, Hangyul Yoon, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出CXReasonAgent,结合大语言模型和临床诊断工具,通过图像生成的诊断和视觉证据进行证据导向的诊断推理,展示了其在多轮对话基准测试中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07023 2026-03-25 q-fin.TR cs.AI 57%

Behavioral Consistency Validation for LLM Agents: An Analysis of Trading-Style Switching through Stock-Market Simulation

对LLM代理的行为一致性验证:通过股票市场模拟分析交易风格切换

Zeping Li, Guancheng Wan, Keyang Chen, Yu Chen, Yiwen Zhao, Philip Torr, Guangnan Ye, Zhenfei Yin, Hongfeng Chai

机构 * Fudan University(复旦大学) Wuhan University(武汉大学) BNP Paribas(BNP巴黎银行) Oxford University(牛津大学) Haven

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过股票市场模拟分析交易风格切换,评估LLM代理策略切换与金融理论的一致性,提出四个行为金融驱动因素作为性格特质,并通过Mann-Whitney U检验比较策略切换行为与理论的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13152 2026-03-25 cs.CV cs.AI 57%

Continuous Patient Monitoring with AI: Real-Time Analysis of Video in Hospital Care Settings

利用AI进行连续患者监测:医院护理环境中的实时视频分析

Paolo Gabriel, Peter Rehani, Tyler Troy, Tiffany Wyatt, Michael Choma, Narinder Singh

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一个AI驱动的平台,用于医院环境中持续被动的患者监测,通过视频分析实时洞察患者行为和互动,提升患者安全和护理质量。

Comments 21 pages, 9 figures, 3 tables, submitted to Frontiers in Imaging > Imaging Applications > (Research Topic) Deep Learning for Medical Imaging Applications for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05036 2026-03-25 cs.HC cs.AI 57%

Mapping the Challenges of HCI: An Application and Evaluation of ChatGPT for Mining Insights at Scale

映射人机交互的挑战:利用ChatGPT进行大规模洞察挖掘的应用与评估

Jonas Oppenlaender, Joonas Hämäläinen

机构 * University of Oulu, Center for Applied Computing, Faculty of Information Technology and Electrical Engineering(奥卢大学,应用计算中心,信息科技与电气工程学院) University of Jyväskylä, Software and Communications Engineering, Faculty of Information Technology(耶夫尼耶斯基大学,软件与通信工程,信息科技学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文评估ChatGPT在从大规模人机交互文献中提取研究挑战的应用,通过两步法提取并筛选挑战,发现与伦理和可及性等领域的强关联,以及人机协作等领域的不足,验证了LLM在大规模定性分析中的实用性。

Comments Accepted in International Journal of Human-Computer Interaction; 45 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22291 2026-03-25 cs.CL 57%

Evaluating Large Language Models' Responses to Sexual and Reproductive Health Queries in Nepali

评估大型语言模型对尼泊尔性与生殖健康问题的回应

Medha Sharma, Supriya Khadka, Udit Chandra Aryal, Bishnu Hari Bhatta, Bijayan Bhattarai, Santosh Dahal, Kamal Gautam, Pushpa Joshi, Saugat Kafle, Shristi Khadka, Shushila Khadka, Binod Lamichhane, Shilpa Lamichhane, Anusha Parajuli, Sabina Pokharel, Suvekshya Sitaula, Neha Verma, Bishesh Khanal

机构 * Nepal Applied Mathematics and Informatics Institute for research(尼泊尔应用数学与信息学研究所) Partnership for Sustainable Development Nepal(尼泊尔可持续发展伙伴关系) Visible Impact(可见影响)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出LEAF框架,评估大型语言模型在尼泊尔性与生殖健康问题上的准确性、语言、可用性及安全性,发现仅35.1%的回应符合标准,揭示了当前模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22290 2026-03-25 cs.CL cs.IR 57%

Less is More: Adapting Text Embeddings for Low-Resource Languages with Small Scale Noisy Synthetic Data

少即是多:利用小规模噪声合成数据适应低资源语言的文本嵌入

Zaruhi Navasardyan, Spartak Bughdaryan, Bagrat Minasyan, Hrant Davtyan

机构 * Metric AI Lab(Metric AI实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文挑战了大规模数据对语义对齐的必要性假设,通过小规模噪声合成数据提升低资源语言文本嵌入性能,实验显示在仅1万对数据下即可获得显著改进,验证了噪声对语义对齐的鲁棒性。

Comments Accepted at LoResLM 2026, EACL 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22279 2026-03-24 cs.CV cs.AI 57%

3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing

3D-Layout-R1: 为语言指导的空间编辑进行结构化推理

Haoyu Zhen, Xiaolong Li, Yilin Zhao, Han Zhang, Sifei Liu, Kaichun Mo, Chuang Gan, Subhashree Radhakrishnan

机构 * NVIDIA UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21698 2026-03-24 cs.AI 57%

A Blueprint for Self-Evolving Coding Agents in Vehicle Aerodynamic Drag Prediction

车辆气动阻力预测中自演化编码代理的蓝图

Jinhui Ren, Huaiming Li, Yabin Liu, Tao Li, Zhaokun Liu, Yujia Liang, Zengle Ge, Chufan Wu, Xiaomin Yuan, Danyu Liu, Annan Li, Jianmin Wu

机构 * Famou Agent Team(Famou 代理团队) Baidu AI Cloud(百度AI云) IAT AI Team(IAT人工智能团队)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于合同的自演化编码代理框架,通过约束优化发现可执行的代理管道,提升车辆阻力系数预测的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21654 2026-03-24 cs.CR cs.AI 57%

Towards Secure Retrieval-Augmented Generation: A Comprehensive Review of Threats, Defenses and Benchmarks

迈向安全的检索增强生成:对威胁、防御和基准的全面综述

Yanming Mu, Hao Hu, Feiyang Li, Qiao Yuan, Jiang Wu, Zichuan Liu, Pengcheng Liu, Mei Wang, Hongwei Zhou, Yuling Liu

机构 * State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Information Engineering University(信息工程大学) Henan Key Laboratory of Information Security(河南省信息安全重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了检索增强生成系统中的安全威胁、防御方法及评估基准,系统分析了数据污染、对抗攻击等核心威胁,并提出双视角的防御技术分类,为未来研究提供统一基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02960 2026-03-24 cs.AI 57%

Architecting Trust in Artificial Epistemic Agents

在人工智能认知代理中构建信任

Nahema Marchal, Stephanie Chan, Matija Franklin, Manon Revel, Geoff Keeling, Roberta Fischli, Bilva Chandra, Iason Gabriel

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文探讨了大规模语言模型作为认知代理的影响,提出通过构建信任、对齐人类认知目标和加强社会认知基础设施,确保AI系统的可靠性与包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16523 2026-03-24 cs.CV cs.AI 57%

TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models

TTP: 视觉-语言模型上的对抗检测与鲁棒适应的测试时填充

Zhiwei Li, Yitian Pang, Weining Wang, Zhenan Sun, Qi Li

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络与模式识别实验室及自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出TTP框架,通过测试时填充实现对抗检测与鲁棒适应,提升视觉-语言模型在对抗攻击下的鲁棒性而不影响清洁准确性。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14977 2026-03-24 cs.RO cs.AI 57%

SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification

SVBRD-LLM:自主车辆识别的自验证行为规则发现

Xiangyu Li, Tianyi Wang, Junfeng Jiao, Christian Claudel, Zhaomiao Guo

机构 * Fariborz Maseeh Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程学院) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出SVBRD-LLM框架,通过零样本大语言模型提取可解释的行为规则,用于自主车辆识别,实现了90.0%的准确率和93.3%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24358 2026-03-24 cs.SE cs.CL 57%

Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation

通过代理驱动的标注和评估自动评估代码代理

Lingyue Fu, Bolun Zhang, Hao Guan, Yaoming Zhu, Lin Qiu, Weiwen Liu, Xuezhi Cao, Xunliang Cai, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出代理驱动的基准构建流程,引入PRDBench包含50个真实Python项目,通过专门模型提升评估准确性,验证了框架的可扩展性和鲁棒性。

Comments Accepted by AAMAS 2026

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24302 2026-03-24 cs.LG 57%

LEAF: Language-EEG Aligned Foundation Model for Brain-Computer Interfaces

LEAF:语言-脑电对齐的基础模型用于脑机接口

Muyun Jiang, Shuailei Zhang, Zhenjie Yang, Mengjun Wu, Weibang Jiang, Zhiwei Guo, Wei Zhang, Rui Liu, Shangen Zhang, Yong Li, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国) University of Science and Technology Beijing, China(北京科技大学,中国) Southeast University, China(东南大学,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 LEAF通过整合语义指导生成结构化的脑电嵌入,提升解码鲁棒性和迁移性,实现语言与脑电信号的对齐,取得12个数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏