arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2602.08716 2026-02-10 cs.CL 57%

PERSPECTRA: A Scalable and Configurable Pluralist Benchmark of Perspectives from Arguments

PERSPECTRA: 一种可扩展且可配置的多元视角论证基准

Shangrui Nie, Kian Omoomi, Lucie Flek, Zhixue Zhao, Charles Welch

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 PERSPECTRA提出了一种结合结构清晰与语义多样性的多元视角论证基准,用于评估模型在处理多个视角时的表示、区分与推理能力。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08342 2026-02-10 cs.CV cs.AI 57%

UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science

UrbanGraphEmbeddings: 学习和评估空间导向的多模态嵌入用于城市科学

Jie Zhang, Xingtong Yu, Yuan Fang, Rudi Stouffs, Zdravko Trivic

机构 * National University of Singapore Department of Architecture Singapore The Chinese University of Hong Kong Dept of Systems Eng. \& Eng. Mgmt. China Singapore Management University School of Computing \& Info. Systems Singapore National University of Singapore Department of Architecture The Chinese University of Hong Kong Singapore Management University

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出UGE框架,通过空间导向的多模态嵌入提升城市理解任务性能,实验显示在图像检索和地理位置排名上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08339 2026-02-10 cs.AI cs.CV 57%

CoTZero: Annotation-Free Human-Like Vision Reasoning via Hierarchical Synthetic CoT

CoTZero:通过分层合成CoT实现无标注的人类级视觉推理

Chengyi Du, Yazhe Niu, Dazhong Shen, Luxin Xu

机构 * University of Electronic Science and Technology of China(电子科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong MMLab(香港中文大学 MMLab) The College of Computer Science and Technology(计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 CoTZero通过双阶段数据合成和认知对齐训练,实现无标注的人类级视觉推理,提升模型的层次推理和泛化能力。

Comments 16 pages 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08121 2026-02-10 cs.AI 57%

Initial Risk Probing and Feasibility Testing of Glow: a Generative AI-Powered Dialectical Behavior Therapy Skills Coach for Substance Use Recovery and HIV Prevention

Glow的初始风险探测与可行性测试:一种生成式人工智能驱动的辩证行为疗法技能教练,用于物质使用康复和HIV预防

Liying Wang, Madison Lee, Yunzhang Jiang, Steven Chen, Kewei Sha, Yunhe Feng, Frank Wong, Lisa Hightow-Weidman, Weichao Yuwen

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Glow是一种生成式人工智能驱动的辩证行为疗法技能教练,旨在通过风险探测和可行性测试评估其在物质使用康复和HIV预防中的安全性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10238 2026-02-10 cs.AI 57%

The Achilles' Heel of LLMs: How Altering a Handful of Neurons Can Cripple Language Abilities

大语言模型的致命弱点:改变少量神经元即可摧毁语言能力

Zixuan Qin, Qingchen Yu, Kunlin Lyu, Zhaoxin Fan, Yifan Sun

机构 * Center for Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) School of Artificial Intelligence, Beihang University(北航人工智能学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究发现大语言模型中存在关键神经元集,破坏这些神经元可导致模型崩溃,揭示了模型鲁棒性和可解释性的重要问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11472 2026-02-10 cs.CV cs.LG 57%

Toward Inherently Robust VLMs Against Visual Perception Attacks

朝向对抗视觉感知攻击的固有鲁棒性VLMs

Pedram MohajerAnsari, Amir Salarpour, Michael Kühr, Siyu Huang, Mohammad Hamad, Sebastian Steinhorst, Habeeb Olufowobi, Bing Li, Mert D. Pesé

机构 * Clemson University(克莱姆森大学) Technical Universität München(慕尼黑技术大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出V2LMs,通过固有鲁棒性提升自动驾驶车辆感知对视觉攻击的抗性,实验显示其在对抗攻击下表现优于传统DNNs。

Comments Accepted to the 2026 IEEE Intelligent Vehicles Symposium (IV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00765 2026-02-10 cs.AI 57%

HouseTS: A Large-Scale, Multimodal Spatiotemporal U.S. Housing Dataset and Benchmark

HouseTS:一个大规模、多模态的美国住房时空数据集和基准

Shengkun Wang, Yanshen Sun, Fanglan Chen, Linhan Wang, Naren Ramakrishnan, Chang-Tien Lu, Yinlin Chen

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 HouseTS是一个大规模多模态美国住房时空数据集,用于提供长期房价预测的基准,涵盖超过6000个邮政编码的月度数据,并支持多种模型的评估与可解释性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07978 2026-02-10 cs.CL 57%

Cross-Linguistic Persona-Driven Data Synthesis for Robust Multimodal Cognitive Decline Detection

跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测

Rui Feng, Zhiyao Luo, Liuyu Wu, Wei Wang, Yuting Song, Yong Liu, Kok Pin Ng, Jianqing Li, Xingyao Wang

机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07814 2026-02-10 cs.CV cs.AI 57%

How well are open sourced AI-generated image detection models out-of-the-box: A comprehensive benchmark study

开源生成图像检测模型的即插即用性能如何:一项全面的基准研究

Simiao Ren, Yuchen Zhou, Xingyu Shen, Kidus Zewde, Tommy Duong, George Huang, Hatsanai, Tiangratanakul, Tsang, Ng, En Wei, Jiayu Xue

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文评估了16种最新图像检测模型的即插即用性能,发现无统一最佳模型,训练数据对齐影响显著,现代生成器性能优异,揭示了跨数据集泛化中的系统性故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07706 2026-02-10 cs.LG 57%

Dense Feature Learning via Linear Structure Preservation in Medical Data

通过线性结构保持实现密集特征学习:医学数据

Yuanyun Zhang, Mingxuan Zhang, Siyuan Li, Zihan Wang, Haoran Chen, Wenbo Zhou, Shi Li

机构 * Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出密集特征学习方法,通过线性结构保持提升医学数据表示的稳定性与可解释性,实现更优的下游性能。

Comments ICLR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07662 2026-02-10 cs.AI 57%

ONTrust: A Reference Ontology of Trust

ONTrust:信任的参考本体

Glenda Amaral, Tiago Prince Sales, Riccardo Baratella, Daniele Porello, Renata Guizzardi, Giancarlo Guizzardi

机构 * Semantics, Cybersecurity \& Services, University of Twente, The Netherlands Business Information Systems, University of Twente, The Netherlands DAFIST, University of Genoa, Italy

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 ONTrust通过构建信任参考本体,提供信任概念的本体学基础,支持信息建模、自动推理和语义互操作性,应用于信任管理、AI设计等领域。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07652 2026-02-10 cs.CR cs.AI 57%

Agent-Fence: Mapping Security Vulnerabilities Across Deep Research Agents

Agent-Fence: 在深度研究代理中映射安全漏洞

Sai Puppala, Ismail Hossain, Md Jahangir Alam, Yoonpyo Lee, Jay Yoo, Tanzim Ahad, Syed Bahauddin Alam, Sajedul Talukder

机构 * Computer Science Department, Southern Illinois University(索尔坦大学计算机科学系) Computer Science Department, University of Texas(德克萨斯大学计算机科学系) Hanyang University(翰阳大学) The Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格雷格尔工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Agent-Fence通过定义14种信任边界攻击类别,评估深度代理的安全性,发现高风险类别如Denial-of-Wallet和Authorization Confusion,揭示代理在持久交互中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22978 2026-02-10 cs.CL 57%

ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?

ShoppingComp: LLMs 是否真的准备好为您的购物车服务?

Huaixiao Tou, Ying Zeng, Yuemeng Li, Cong Ma, Muzhi Li, Minghao Li, Weijie Yuan, He Zhang, Kai Jia

机构 * ByteDance(字节跳动)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 ShoppingComp通过现实世界基准揭示LLM在购物代理任务中的局限性,强调其在信息定位、多约束验证和风险决策方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16813 2026-02-10 cs.CL 57%

Cognitive Linguistic Identity Fusion Score (CLIFS): A Scalable Cognition-Informed Approach to Quantifying Identity Fusion from Text

认知语言身份融合评分(CLIFS):一种可扩展的认知导向方法,用于从文本中量化身份融合

Devin R. Wright, Jisun An, Yong-Yeol Ahn

机构 * Center for Complex Networks and Systems Research, Luddy School of Informatics, Computing, and Engineering, Indiana University Bloomington(复杂网络与系统研究中心,信息学、计算与工程学院,印第安纳大学布卢明顿分校) Cognitive Science Program, Indiana University Bloomington(认知科学项目,印第安纳大学布卢明顿分校) School of Data Science, University of Virginia(数据科学学院,弗吉尼亚大学) CulturePulse, Inc.(CulturePulse公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 CLIFS通过整合认知语言学与大语言模型,提供一种自动化方法来量化文本中的身份融合,有效提升暴力风险评估的准确性。

Comments Authors' accepted manuscript (postprint; camera-ready). To appear in the Proceedings of EMNLP 2025. Pagination/footer layout may differ from the Version of Record

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07014 2026-02-10 cs.CV cs.AI 57%

Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation

Vectra: 一种新的度量标准、数据集和模型用于电子商务图像中的图像翻译视觉质量评估

Qingyu Wu, Yuxuan Han, Haijun Li, Zhao Xu, Jianshan Zhao, Xu Jin, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Vectra提出了一种无参考、基于大语言模型的视觉质量评估框架,通过多维度量系统、数据集和模型提升电子商务图像翻译的视觉质量评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06998 2026-02-10 cs.CY 57%

Tokenizations for Austronesian Language Models: study on languages in Indonesia Archipelago

印尼群岛语言模型的分词:对印尼群岛地区语言的研究

Andhika Bernard Lumbantobing, Hokky Situngkir

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 本研究提出基于音节的分词方法,用于印尼群岛地区语言,通过音节分割和传统印尼文字原则,提升多语言LLM的语音和形态模式保留能力。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11840 2026-02-10 cs.AI cs.LO cs.SE 57%

Imandra CodeLogician: Neuro-Symbolic Reasoning for Precise Analysis of Software Logic

Imandra CodeLogician: 用于软件逻辑精确分析的神经符号推理

Hongyu Lin, Samer Abdallah, Makar Valentinov, Paul Brennan, Elijah Kagan, Christoph M. Wintersteiger, Denis Ignatovich, Grant Passmore

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Imandra CodeLogician通过神经符号推理提升软件逻辑分析的精确性,结合形式方法与LLM,实现更严谨的程序验证与分析。

Comments 52 pages, 23 figures. Includes a new benchmark dataset (code-logic-bench) and evaluation of neurosymbolic reasoning for software analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06955 2026-02-09 cs.LG 57%

Improving Credit Card Fraud Detection with an Optimized Explainable Boosting Machine

通过优化可解释提升机改善信用卡欺诈检测

Reza E. Fazel, Arash Bakhtiary, Siavash A. Bigdeli

机构 * ReDi School(ReDi学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文通过优化可解释提升机算法,提升信用卡欺诈检测的准确性和可解释性,实验结果显示其在ROC-AUC指标上优于多种传统方法。

Comments 22 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06631 2026-02-09 cs.CY 57%

Estimating Exam Item Difficulty with LLMs: A Benchmark on Brazil's ENEM Corpus

利用LLM估算考试题目难度:在巴西ENEM语料库上的基准测试

Thiago Brant, Julien Kühn, Jun Pang

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文研究了LLM在估算考试题目难度上的表现,发现其在单模态问题上表现中等,但对多模态问题和人口统计数据提示的适应性有限,建议采用评估后再生成的流程进行负责任的评估设计。

Comments 42 pages, 19 figures. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06616 2026-02-09 cs.CR cs.LG 57%

Confundo: Learning to Generate Robust Poison for Practical RAG Systems

Confundo: 学习生成稳健的毒药以应对实际RAG系统

Haoyang Hu, Zhejun Jiang, Yueming Lyu, Junyuan Zhang, Yi Liu, Ka-Ho Chow

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 Confundo是一种学习生成毒药的框架,通过微调大型语言模型以提高RAG系统的鲁棒性和隐蔽性,有效应对实际系统中的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06384 2026-02-09 cs.CL 57%

FMBench: Adaptive Large Language Model Output Formatting

FMBench: 自适应大语言模型输出格式化

Yaoting Wang, Yun Zhou, Henghui Ding

机构 * Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 FMBench通过结合监督微调和强化学习微调,提升大语言模型在Markdown格式化任务中的语义和结构准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00169 2026-02-09 cond-mat.mtrl-sci cs.AI 57%

Towards Agentic Intelligence for Materials Science

迈向材料科学的代理智能

Huan Zhang, Yizhan Li, Wenhao Huang, Ziyu Hou, Yu Song, Xuye Liu, Farshid Effaty, Jinya Jiang, Sifan Wu, Qianggang Ding, Izumi Takahara, Leonard R. MacGillivray, Teruyasu Mizoguchi, Tianshu Yu, Lizi Liao, Yuyu Luo, Yu Rong, Jia Li, Ying Diao, Heng Ji, Bang Liu

机构 * DIRO & Institut Courtois, Université de Montréal(蒙特利尔大学DIRO与Courtois研究所) Mila – Quebec AI Institute(魁北克AI研究所) University of Waterloo(滑铁卢大学) Université de Sherbrooke(Sherbrooke大学) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Singapore Management University(新加坡管理学院) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州)) Alibaba DAMO Academy(阿里巴巴达摩院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出以流程为中心的代理系统框架,通过整合人工智能与材料科学,推动材料发现的自主化与智能化。

Comments 81 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06013 2026-02-06 cs.CV cs.AI 57%

GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?

GenArena: 如何在视觉生成任务中实现人对齐的评估?

Ruihang Li, Leigang Qu, Jingxu Zhang, Dongnan Gui, Mengde Xu, Xiaosong Zhang, Han Hu, Wenjie Wang, Jiaqi Wang

机构 * University of Science(科学大学) Shanghai Innovation Institute(上海创新研究所) Tencent(腾讯) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 GenArena通过成对比较范式实现视觉生成任务的人对齐评估,使开源模型超越专有模型,提升评估准确性达20%以上。

Comments Project Page: https://genarena.github.io/, Code: https://github.com/ruihanglix/genarena

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13515 2026-02-06 cs.SE cs.CL cs.LO 57%

Fine-tuned LLM-based Code Migration Framework

基于微调的LLM代码迁移框架

Oleg Grynets, Vasyl Lyashkevych, Dmytro Baran, Maksym Orliansky, Taras Zelenyy, Markiian Leshchyshyn

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究提出一种基于微调LLM的代码迁移框架,通过自动化SQL特征检测和半监督错误分析,提升数据库迁移的精度与效率。

Comments 16 pages, 27 figures, 7 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05110 2026-02-06 cs.AI 57%

Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment

理解大语言模型评估者行为:一种结构化多评估者框架用于商户风险评估

Liang Wang, Junpeng Wang, Chin-chia Michael Yeh, Yan Zheng, Jiarui Sun, Xiran Fan, Xin Dai, Yujie Fan, Yiwei Cai

机构 * Visa Research(Visa研究)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种结构化多评估者框架,用于评估LLM在商户风险评估中的推理质量,揭示了不同模型的自我评估偏见差异,并通过真实数据验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04617 2026-02-05 cs.CL 57%

LEAD: Layer-wise Expert-aligned Decoding for Faithful Radiology Report Generation

LEAD:逐层专家对齐解码以生成准确的放射学报告

Ruixiao Yang, Yuanhe Tian, Xu Yang, Huiqi Li, Yan Song

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 LEAD通过逐层专家对齐解码方法,提升放射学报告生成的准确性并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04152 2026-02-05 cs.RO cs.AI 57%

MA3DSG: Multi-Agent 3D Scene Graph Generation for Large-Scale Indoor Environments

MA3DSG:多智能体3D场景图生成用于大规模室内环境

Yirum Kim, Jaewoo Kim, Ue-Hwan Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合学院,全州科学技术院(GIST))

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MA3DSG通过多智能体协作实现大规模室内环境的3D场景图生成,无需训练参数即可提升扩展性与协同能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04131 2026-02-05 cs.LG 57%

Decoupling Time and Risk: Risk-Sensitive Reinforcement Learning with General Discounting

解耦时间和风险:具有通用折扣的风险敏感强化学习

Mehrdad Moghimi, Anthony Coache, Hyejin Ku

机构 * Dept. of Mathematics and Statistics(数学与统计学系) York University(约克大学) Dept. of Mathematics(数学系) Imperial College(帝国理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种支持灵活折扣和风险度量优化的新型分布式强化学习框架,通过技术分析和实验验证,展示了折扣在捕捉时空和风险偏好中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04064 2026-02-05 cs.CY 57%

The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks

公民查询基准:一种新的数据集和评估流程,用于衡量LLM在公民查询任务中的性能

Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 本文提出CitizenQuery-UK数据集和评估流程,用于评估LLM在公民查询任务中的可信度,发现模型在事实性、回避率和冗余性方面存在差异,强调了可信赖AI的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00642 2026-02-04 cs.CL 57%

LegalOne: A Family of Foundation Models for Reliable Legal Reasoning

LegalOne:一种用于可靠法律推理的基础模型家族

Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingyao Ai, Yiqun Liu, Cheng Luo, Quan Zhou, Ya Zhang, Jikun Hu

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) Quancheng Laboratory(清华云城实验室) University of Waterloo, Canada(加拿大滑铁卢大学) China University of Political Science and Law(中国政法大学) MegaTech.AI Inc(MegaTech.AI公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 LegalOne通过三阶段流程提升法律推理能力,结合领域适应、代理推理蒸馏和课程强化学习,在法律任务中取得超越通用LLMs的性能。

Comments 25 pages, v1

详情

展开后加载摘要…

URL PDF HTML 收藏