arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2512.15751 2025-12-19 cs.LG cs.AI cs.MA 62%

GLOW: Graph-Language Co-Reasoning for Agentic Workflow Performance Prediction

GLOW:基于图-语言协同推理的代理工作流性能预测

Wei Guan, Jian Cao, Jinyu Cai, Qiqi Cai, Jianqi Gao, See-Kiong Ng

机构 * School of Computer Science, Shanghai Jiao Tong University, China(上海交通大学计算机科学学院) Institute of Data Science, National University of Singapore, Singapore(新加坡国立大学数据科学研究所) School of Computer Engineering and Science, Shanghai University, China(上海大学计算机工程与科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GLOW通过结合图神经网络与大语言模型,提出了一种统一的代理工作流性能预测框架,有效捕捉拓扑依赖和语义逻辑,提升预测准确性与排序效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09149 2025-12-19 cs.CL cs.AI 62%

MindShift: Analyzing Language Models' Reactions to Psychological Prompts

MindShift: 分析语言模型对心理提示的反应

Anton Vasiliuk, Irina Abdullaeva, Polina Druzhinina, Anton Razzhigaev, Andrey Kuznetsov

机构 * FusionBrain Lab(融合大脑实验室) Applied AI Institute(应用人工智能研究院) Innopolis University(因诺普里斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 MindShift通过评估语言模型对心理提示的反应,揭示了模型在心理适应性和人格模拟方面的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05368 2025-12-19 cs.RO cs.AI cs.LG 62%

Long-Horizon Visual Imitation Learning via Plan and Code Reflection

通过计划与代码反思实现长 horizon 视觉模仿学习

Quan Chen, Chenrui Shi, Qi Chen, Yuwei Wu, Zhi Gao, Xintong Zhang, Rui Gao, Kun Wu, Yunde Jia

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science and Technology, Beijing Institute of Technology, China(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学,中国) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过计划与代码反思模块提升长 horizon 视觉模仿学习性能,引入 LongVILBench 基准验证方法有效性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01899 2025-12-18 cs.LG cs.AI cs.HC 62%

Multimodal Foundation Models for Early Disease Detection

多模态基础模型用于早期疾病检测

Md Talha Mohsin, Ismail Abdulrashid

机构 * The University of Tulsa(塔尔萨大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多模态基础模型,通过整合电子病历、医学影像、基因组学和可穿戴传感器数据,提升早期疾病检测的准确性和鲁棒性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14562 2025-12-17 cs.CL cs.AI 62%

Polypersona: Persona-Grounded LLM for Synthetic Survey Responses

Polypersona:基于身份的LLM生成合成调查回应

Tejaswani Dash, Dinesh Karri, Anudeep Vurity, Gautam Datla, Tazeem Ahmad, Saima Rafi, Rohith Tangudu

机构 * George Mason University, Virginia, USA(乔治·马歇尔大学) New Jersey Institute of Technology (NJIT), New Jersey, USA(新泽西理工学院) University of Southern Queensland, Queensland, Australia(南方昆士兰大学) Edinburgh Napier University, Edinburgh, Scotland(爱丁堡纳皮尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 PolyPersona通过基于身份的微调,使小型语言模型能生成可靠且一致的合成调查数据,实现多领域高效调查数据生成。

Comments Accepted in IEEE Bigdata 2025- LLMs4ALL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14330 2025-12-17 cs.CY cs.AI cs.CR 62%

Criminal Liability in AI-Enabled Autonomous Vehicles: A Comparative Study

人工智能赋能的自动驾驶车辆中的刑事责任:比较研究

Sahibpreet Singh, Manjit Singh

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过比较研究分析人工智能赋能自动驾驶车辆中的刑事责任问题,探讨不同国家的监管差异及责任归属机制,强调全球法律统一对技术发展的重要性。

Comments Published in Journal of University Institute of Legal Studies, Vol. 18, Issue 1, pp. 57-78, 2025

Journal ref Journal of University Institute of Legal Studies 18(1), 57-78 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13330 2025-12-16 cs.CL cs.AI 62%

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集

Joona Kytöniemi, Jousia Piha, Akseli Reunamo, Fedor Vitiugin, Farrokh Mehryary, Sampo Pyysalo

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10284 2025-12-16 cs.CV cs.AI cs.CL 62%

MotionEdit: Benchmarking and Learning Motion-Centric Image Editing

MotionEdit: 动作导向图像编辑的基准测试与学习

Yixin Wan, Lei Ke, Wenhao Yu, Kai-Wei Chang, Dong Yu

机构 * Tencent AI(腾讯AI) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 MotionEdit提出一个动作导向图像编辑数据集及评估基准,通过MotionNFT框架提升编辑质量和运动保真度。

Comments Technical Report. We propose MotionEdit, a dataset and benchmark for motion-centric image editing. We also introduce MotionNFT, a reward training framework to improve existing models with motion-aware guidance. Github: https://github.com/elainew728/motion-edit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11931 2025-12-16 cs.CY cs.AI 62%

Mapping AI Risk Mitigations: Evidence Scan and Preliminary AI Risk Mitigation Taxonomy

映射AI风险缓解:证据扫描与初步AI风险缓解分类

Alexander K. Saeri, Sophia Lloyd George, Jess Graham, Clelia D. Lacarriere, Peter Slattery, Michael Noetel, Neil Thompson

专题命中 安全评测 :red teaming(abstract);分类 cs.AI、cs.CY

AI总结 本文提出初步AI风险缓解分类法,通过证据扫描整合AI风险缓解措施,为不同利益相关者提供协调降低AI风险的结构化框架。

Comments Access AI Risk Mitigation Database and Taxonomy at https://airisk.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11887 2025-12-16 cs.CY cs.AI 62%

Advancing Autonomous Driving System Testing: Demands, Challenges, and Future Directions

推进自动驾驶系统测试:需求、挑战与未来方向

Yihan Liao, Jingyu Zhang, Jacky Keung, Yan Xiao, Yurou Dai

机构 * City University of Hong Kong(香港城市大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Lehigh University(莱斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究探讨了自动驾驶系统测试的需求与挑战,指出现有测试技术在现实性能评估中的不足,并提出了未来研究方向,包括系统化测试标准、跨模型协作及可扩展验证框架。

Comments Accepted for publication in Information and Software Technology (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11830 2025-12-16 cs.LG cs.AI 62%

CR3G: Causal Reasoning for Patient-Centric Explanations in Radiology Report Generation

CR3G:用于放射学报告生成的患者导向因果推理

Satyam Kumar

机构 * IIT Bombay(博伊斯大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 CR3G通过因果推理提升放射学报告生成的解释能力,增强AI诊断的可信度和实用性。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12859 2025-12-16 cs.CY cs.AI 62%

Three Lenses on the AI Revolution: Risk, Transformation, Continuity

人工智能革命的三个视角:风险、变革与连续性

Masoud Makrehchi

机构 * Ontariotechu(安大略技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文从风险、变革与连续性三个视角探讨AI革命,指出其兼具进化与革命特性,需通过治理与责任机制确保安全与公平。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10313 2025-12-15 cs.AI cs.CY 62%

EpiPlanAgent: Agentic Automated Epidemic Response Planning

EpiPlanAgent:基于代理的自动化疫情响应规划

Kangkun Mao, Fang Xu, Jinru Ding, Yidong Jiang, Yujun Yao, Yirong Chen, Junming Liu, Xiaoqin Wu, Qian Wu, Xiaoyan Huang, Jie Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Center For Disease Control and Prevention(上海市疾病预防控制中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 EpiPlanAgent利用大语言模型和多代理框架,实现自动化疫情响应规划,显著提升计划完整性并减少开发时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10098 2025-12-13 cs.LG cs.AI 62%

MedXAI: A Retrieval-Augmented and Self-Verifying Framework for Knowledge-Guided Medical Image Analysis

MedXAI: 一种结合检索增强和自我验证的框架,用于知识引导的医学图像分析

Midhat Urooj, Ayan Banerjee, Farhat Shaikh, Kuntal Thakur, Sandeep Gupta

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 MedXAI通过整合深度学习与临床专家知识,提升医学图像分析的可解释性和泛化能力,尤其在稀有疾病检测中表现优异。

Comments https://cmsworkshops.com/Asilomar2025/Papers/Uploads/FinalPapers/Original/1527/20251130102314_899554_1527.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10195 2025-12-12 cs.CL cs.LG cs.MA 62%

AutoMedic: An Automated Evaluation Framework for Clinical Conversational Agents with Medical Dataset Grounding

AutoMedic: 一种用于具有医学数据集支撑的临床对话代理的自动化评估框架

Gyutaek Oh, Sangjoon Park, Byung-Hoon Kim

机构 * Yonsei University College of Medicine(延世大学医学院) Yonsei Institute for Digital Health(延世大学数字健康研究所) Yonsei University(延世大学) Institute of Behavioral Sciences in Medicine(医学行为科学研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 AutoMedic是一种基于医学数据集的自动化评估框架,用于评估临床对话代理的多方面性能,包括准确性、效率、同理心和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11375 2025-12-12 cs.AI cs.CL 62%

Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables

在化学表格上评估多模态大语言模型的基准测试

Yitong Zhou, Mingyue Cheng, Qingyang Mao, Yucong Luo, Qi Liu, Yupeng Li, Xiaohan Zhang, Deguang Liu, Xin Li, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Artificial Intelligence Research Institute(人工智能研究院) iFLYTEK Co., Ltd(iFLYTEK公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChemTable基准,用于评估多模态模型在理解化学表格中的能力,揭示了现有模型在跨模态对齐和领域推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07021 2025-12-09 cs.LG cs.AI 62%

Transferring Clinical Knowledge into ECGs Representation

将临床知识转移到ECG表示中

Jose Geraldo Fernandes, Luiz Facury de Souza, Pedro Robles Dutenhefner, Gisele L. Pappa, Wagner Meira

机构 * Department of Computer Science(计算机科学系) Universidade Federal de Minas Gerais(巴西矿务联邦大学) Depart. of Math. and Comp. Sc.(数学与计算机科学系) Albion College(阿尔比恩学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种三阶段训练方法,将多模态临床数据转化为ECG表示,提升分类模型的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06161 2025-12-09 cs.AI cs.LG 62%

Deep learning for autism detection using clinical notes: A comparison of transfer learning for a transparent and black-box approach

利用临床笔记进行自闭症检测的深度学习:透明与黑箱方法的迁移学习比较

Gondy Leroy, Prakash Bisht, Sai Madhuri Kandula, Nell Maltman, Sydney Rice

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种基于BioBERT的透明机器学习方法,通过混合数据集训练提升了自闭症检测的准确率,优于黑箱方法。

Comments 9 pages

Journal ref Artificial Intelligence in Medicine, February, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05994 2025-12-09 eess.AS cs.AI cs.CL cs.SD 62%

KidSpeak: A General Multi-purpose LLM for Kids' Speech Recognition and Screening

KidSpeak: 一个通用的多用途大语言模型用于儿童语音识别与筛查

Rohan Sharma, Dancheng Liu, Jingchen Sun, Shijie Zhou, Jiayu Qin, Jinjun Xiong, Changyou Chen

机构 * Department of Computer Science and Engineering, State University of New York at Buffalo(计算机科学与工程系,纽约州立大学布法罗分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 KidSpeak是首个为儿童语音识别与筛查设计的多用途大语言模型,结合语音增强技术与FASA对齐工具,实现87%的准确率,提升儿童语音数据质量13.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05334 2025-12-08 cs.IR cs.AI cs.CL 62%

The Effect of Document Summarization on LLM-Based Relevance Judgments

文档摘要对基于大语言模型的相关性判断的影响

Samaneh Mohtadi, Kevin Roitero, Stefano Mizzaro, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了文档摘要对基于大语言模型的相关性判断可靠性及IR评估的影响,发现摘要判断在稳定性上与完整文档判断相当,但引入了系统性的标签偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00010 2025-12-08 cs.IR cs.AI cs.CL 62%

EnterpriseEM: Fine-tuned Embeddings for Enterprise Semantic Search

EnterpriseEM: 企业语义搜索的微调嵌入

Kamalkumar Rathinasamy, Jayarama Nettar, Amit Kumar, Vishal Manchanda, Arun Vijayakumar, Ayush Kataria, Venkateshprasanna Manjunath, Chidambaram GS, Jaskirat Singh Sodhi, Shoeb Shaikh, Wasim Akhtar Khan, Prashant Singh, Tanishq Dattatray Ige, Vipin Tiwari, Rajab Ali Mondal, Harshini K, S Reka, Chetana Amancharla, Faiz ur Rahman, Harikrishnan P A, Indraneel Saha, Bhavya Tiwary, Navin Shankar Patel, Pradeep T S, Balaji A J, Priyapravas, Mohammed Rafee Tarafdar

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EnterpriseEM方法,通过微调预训练嵌入模型提升企业语义搜索的精度与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16003 2025-12-04 cs.LG cs.AI 62%

Choose Your Explanation: A Comparison of SHAP and GradCAM in Human Activity Recognition

选择你的解释:SHAP和GradCAM在人类活动识别中的比较

Felix Tempel, Daniel Groos, Espen Alexander F. Ihlen, Lars Adde, Inga Strümke

机构 * Faculty of Informatics, Norwegian University of Science and Technology(1 信息学院,挪威科学与技术大学) Faculty of Medicine and Health Sciences, Norwegian University of Science and Technology(2 医学与健康科学学院,挪威科学与技术大学) Department of Clinical and Molecular Medicine, NTNU(3 临床与分子医学系,NTNU) Clinic of Rehabilitation, St. Olavs Hospital, Trondheim University Hospital(4 康复诊所,圣奥拉夫医院,特伦德尔姆大学医院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了SHAP和Grad-CAM在人类活动识别中的应用,分析了两种方法在特征重要性、可解释性和模型敏感性上的差异,为选择合适解释方法提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02763 2025-12-03 cs.CL cs.AI 62%

SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys

SurveyEval: 向LLM生成学术调查的全面评估迈进

Jiahao Zhao, Shuaixing Zhang, Nan Xu, Lei Wang

机构 * Beijing Wenge Technology Co., Ltd.(北京文格科技有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SurveyEval通过多维度评估LLM生成的学术调查,揭示了专门系统在质量上的优势,并为改进自动调查系统提供可扩展的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01282 2025-12-03 cs.CL cs.AI 62%

Kardia-R1: Unleashing LLMs to Reason toward Understanding and Empathy for Emotional Support via Rubric-as-Judge Reinforcement Learning

Kardia-R1: 通过Rubric-as-Judge强化学习释放大语言模型以通过评分标准进行推理,以实现情感支持的理解与共情

Jiahao Yuan, Zhiqing Cui, Hanqing Wang, Yuansheng Gao, Yucheng Zhou, Usman Naseem

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 Kardia-R1通过Rubric-as-Judge强化学习框架,提升大语言模型在情感支持中的理解与共情能力,通过评分标准引导训练以实现更准确的情感推理和个性化响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15272 2025-12-03 cs.CV cs.AI cs.CL 62%

CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios

CT-GLIP:基于CT扫描和放射报告的3D grounded语言-图像预训练,用于全身场景

Jingyang Lin, Yingda Xia, Jianpeng Zhang, Ke Yan, Kai Cao, Le Lu, Jiebo Luo, Ling Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) University of Rochester(罗切斯特大学) Hupan Lab, \postcode 10587, \state Hangzhou, \country China(华普实验室,浙江省杭州市,中国) Department of Radiology, Shanghai Institution of Pancreatic Disease, \state Shanghai, \country China(胰腺疾病研究所放射科,上海市,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 CT-GLIP通过构建细粒度CT报告对,提升3D grounded语言-图像预训练,实现更精确的跨模态对齐,从而在零样本任务中提升器官识别和肿瘤检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01119 2025-12-02 cs.LG cs.AI 62%

World Model Robustness via Surprise Recognition

通过惊喜识别提升世界模型鲁棒性

Geigh Zollicoffer, Tanush Chopra, Mingkuan Yan, Xiaoxu Ma, Kenneth Eaton, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过惊喜识别提升世界模型在噪声环境下的鲁棒性,增强自动驾驶模拟中智能体的稳定性与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22338 2025-12-02 cs.CL cs.AI 62%

Advancing Natural Language Formalization to First Order Logic with Fine-tuned LLMs

通过微调LLMs推进自然语言形式化到一阶逻辑

Felix Vossel, Till Mossakowski, Björn Gehrke

机构 * Osnabrück University(奥斯纳布鲁克大学) University of Zurich(苏黎世大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过微调LLMs提升自然语言到一阶逻辑的转换性能,实验显示谓词可用性显著提升模型表现,T5模型优于大解码器-only模型,并能泛化至未见逻辑论证。

Comments 15 pages, 7 tables, accepted at the International Joint Conference on Learning & Reasoning (IJCLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17442 2025-12-02 cs.CL cs.AI 62%

Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring

Confident RAG: 通过多嵌入和置信度评分提升LLM在数学问题回答中的性能

Shiting Chen, Zijian Zhao, Jinsong Chen

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 Confident RAG通过多嵌入和置信度评分提升LLM在数学问题回答中的性能,实验表明其在准确率上比普通LLMs和RAG分别提升10%和5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00046 2025-12-02 cs.CL cs.AI 62%

Text Annotation via Inductive Coding: Comparing Human Experts to LLMs in Qualitative Data Analysis

通过归纳编码进行文本标注:在定性数据分析中比较人类专家与大语言模型

Angelina Parfenova, Andreas Marfurt, Alexander Denzler, Juergen Pfeffer

机构 * Lucerne University of Applied Sciences and Arts(卢塞恩应用科学大学) Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了人类专家与大语言模型在定性数据分析中的表现,发现人类在处理复杂句子时表现优异,而LLMs在简单句子上表现更佳。

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12899 2025-12-02 cs.SE cs.CL cs.LG 62%

A Semantic-based Optimization Approach for Repairing LLMs: Case Study on Code Generation

基于语义的优化方法用于修复大语言模型:代码生成的案例研究

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

机构 * Monash University(墨尔本大学) Technical University of Munich(慕尼黑技术大学) Chongqing University(重庆大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STAR方法,通过基于语义的优化修复大语言模型,提升代码生成的准确性和效率。

Comments 13 pages, 6 figure, 8 tables, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏