arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-14 至 2026-01-14 共收录 188 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 36 篇

2601.06002 2026-01-14 cs.CL cs.AI 73%

The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning

思维的分子结构:映射长链推理的拓扑结构

Qiguang Chen, Yantao Du, Ziniu Li, Jinhao Liu, Songyao Duan, Jiarui Guo, Minghao Liu, Jiaheng Liu, Tong Yang, Ge Zhang, Libo Qin, Wanxiang Che, Wenhao Huang

机构 * LARG, SCIR, Harbin Institute of Technology(LARG、SCIR、哈尔滨工业大学) Peking University(北京大学) Nanjing University(南京大学) Central South University(中南大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过分子结构类比理解长链推理的拓扑特性,引入有效语义异构体概念,并提出Mole-Syn方法提升长链推理性能和稳定性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15793 2026-01-14 cs.CL cs.LG 73%

Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data

以格式为先:量化和分析LLM在异构数据中的偏见

Jiacheng Liu, Mayi Xu, Qiankun Pi, Wenli Li, Ming Zhong, Yuanyuan Zhu, Mengchi Liu, Tieyun Qian

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过三阶段分析,揭示了LLM在处理异构数据时的格式偏见问题,提出通过数据预处理、推理干预和平衡训练语料库来减少偏见的方法。

Comments Accepted by AAAI 2026, camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02962 2026-01-14 cs.CL cs.AI cs.IR 73%

RAG-R1: Incentivizing the Search and Reasoning Capabilities of LLMs through Multi-query Parallelism

RAG-R1:通过多查询并行性激励大语言模型的搜索与推理能力

Zhiwen Tan, Jiaming Huang, Qintong Wu, Hongxuan Zhang, Chenyi Zhuang, Jinjie Gu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RAG-R1通过多查询并行性提升大语言模型的搜索与推理能力,实验显示其在问答基准中性能优于基线方法,推理效率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20315 2026-01-14 cs.CL cs.AI 73%

Arctic-Text2SQL-R1: Simple Rewards, Strong Reasoning in Text-to-SQL

Arctic-Text2SQL-R1: 简单奖励,强推理的文本到SQL

Zhewei Yao, Guoheng Sun, Lukasz Borchmann, Gaurav Nuti, Zheyu Shen, Minghang Deng, Bohan Zhai, Hao Zhang, Ang Li, Yuxiong He

机构 * Snowflake AI Research(Snowflake AI研究院) University of Maryland(马里兰大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Arctic-Text2SQL-R1通过简单奖励机制和强化学习框架,在文本到SQL任务中实现高准确率和高效性,优于现有大型模型。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08444 2026-01-14 cs.AI 70%

Beyond Linearization: Attributed Table Graphs for Table Reasoning

超越线性化:属性表格图用于表格推理

Yuxiang Wang, Junhao Gan, Shengxiang Gao, Shenghao Ye, Zhengyi Yang, Jianzhong Qi

机构 * The University of Melbourne(墨尔本大学) The University of New South Wales(新南威尔士大学) The University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TABGR模型,通过属性表格图保留表格结构并提升推理可解释性,实验表明其在表格推理任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07553 2026-01-14 cs.AI q-bio.QM 70%

GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition

GTR-CoT:图遍历作为视觉推理链用于分子结构识别

Jingchao Wang, Yifan He, Haote Yang, Jiang Wu, Lingli Ge, Xingjian Wei, Yinfan Wang, Linye Li, Huijie Ao, Chengjin Liu, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 GTR-CoT通过图遍历机制和强化学习提升手绘分子结构识别性能,构建首个细粒度评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03215 2026-01-14 cs.AI 70%

COSINT-Agent: A Knowledge-Driven Multimodal Agent for Chinese Open Source Intelligence

COSINT-Agent: 一种面向中文开源情报的知识驱动多模态智能体

Wentao Li, Congcong Wang, Xiaoxiao Cui, Zhi Liu, Wei Guo, Lizhen Cui

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 COSINT-Agent通过整合多模态大语言模型与实体-事件-场景知识图谱,提升中文开源情报的多模态推理能力与情报生成效率。

Comments This manuscript (arXiv:2503.03215) is being withdrawn at the supervisor's request. The content is preliminary and needs further internal revision and approval before public release. We will resubmit a revised version after completion. Apologies for the inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08691 2026-01-14 cs.SE 67%

LLMs in Code Vulnerability Analysis: A Proof of Concept

在代码漏洞分析中使用LLMs:概念验证

Shaznin Sultana, Sadia Afreen, Nasir U. Eisty

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文探讨利用LLMs在代码漏洞分析中的应用,通过微调和提示方法评估模型性能,发现代码专用模型在复杂任务中表现优异,但现有指标不足以衡量修复质量。

Comments Accepted for publication at the Fourth International Workshop on Software Vulnerability Management (SVM 2026) co-located with Intenational Conference in Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08259 2026-01-14 cs.NI 67%

Unleashing Tool Engineering and Intelligence for Agentic AI in Next-Generation Communication Networks

释放工具工程与智能以推动下一代通信网络中的智能体AI

Yinqiu Liu, Ruichen Zhang, Dusit Niyato, Abbas Jamalipour, Trung Q. Duong, Dong In Kim

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出通过工具工程和智能提升下一代通信网络中的智能体AI,展示工具智能在无人飞行器轨迹规划中的应用,并提供6G时代的智能体构建路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08282 2026-01-14 cs.CL 57%

D$^2$Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning

D$^2$Plan: 双智能体动态全局规划用于复杂检索增强推理

Kangcheng Luo, Tinglang Wu, Yansong Feng

机构 * Peking University(北京大学)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL

AI总结 D$^2$Plan通过双智能体协作提升复杂检索增强推理的连贯性和抗干扰能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07964 2026-01-14 cs.AI 57%

Executable Ontologies in Game Development: From Algorithmic Control to Semantic World Modeling

可执行本体在游戏开发中的应用:从算法控制到语义世界建模

Alexander Boldachev

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出利用可执行本体实现游戏开发中的语义世界建模,通过数据流条件实现任务中断,解决传统AI架构中的语义-过程鸿沟。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17108 2026-01-14 cs.AI 57%

Structured Debate Improves Corporate Credit Reasoning in Financial AI

结构化辩论提升金融AI中的企业信用推理

Yoonjin Lee, Munhee Kim, Hanbi Choi, Juhyeon Park, Seungho Lyoo, Woojin Park

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 结构化辩论系统在金融AI中通过提升企业信用推理的严谨性和实用性,展示了更深入的分析能力,尽管计算时间较长。

Comments 18 pages, 4 figures, 2 algorithms, 2 tables, 4 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12992 2026-01-14 cs.RO cs.CL cs.CV cs.MA 57%

UNCAP: Uncertainty-Guided Neurosymbolic Planning Using Natural Language Communication for Cooperative Autonomous Vehicles

UNCAP:基于自然语言通信的不确定性引导神经符号规划

Neel P. Bhatt, Po-han Li, Kushagra Gupta, Rohan Siva, Daniel Milan, Alexander T. Hogue, Sandeep P. Chinchali, David Fridovich-Keil, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 UNCAP通过自然语言通信和不确定性引导方法,提升多车辆协同自动驾驶系统的可扩展性和安全性。

Journal ref AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20665 2026-01-14 cs.CV 50%

DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving

DriveRX:一种用于跨任务自动驾驶的视觉-语言推理模型

Muxi Diao, Lele Yang, Hongbo Yin, Zhexu Wang, Yejie Wang, Daxin Tian, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Beihang University(北航)

专题命中 推理与问题求解 :language model(abstract)

AI总结 DriveRX是一种用于自动驾驶的视觉-语言推理模型,通过结构化推理提升多阶段决策能力,并在复杂驾驶条件下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 41 篇

2601.08785 2026-01-14 cs.AI 89%

Uncovering Political Bias in Large Language Models using Parliamentary Voting Records

利用议会投票记录揭示大型语言模型中的政治偏见

Jieying Chen, Karen de Jong, Andreas Poole, Jan Burakowski, Elena Elderson Nosti, Joep Windt, Chendi Wang

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Oslo(奥斯陆大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文通过分析议会投票记录,揭示大型语言模型中的政治偏见,发现其左倾倾向及对右翼保守党的负面偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21503 2026-01-14 cs.AI cs.CV 88%

MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions

MoHoBench: 通过无法回答的视觉问题评估多模态大语言模型的诚实性

Yanxu Zhu, Shitong Duan, Xiangxu Zhang, Jitao Sang, Peng Zhang, Tun Lu, Xiao Zhou, Jing Yao, Xiaoyuan Yi, Xing Xie

机构 * Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 MoHoBench通过评估多模态大语言模型在面对无法回答的视觉问题时的诚实行为,揭示其诚实性受视觉信息影响,提出改进方法以提升模型可信度。

Comments AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17899 2026-01-14 cs.CL 88%

Can Large Language Models Identify Implicit Suicidal Ideation? An Empirical Evaluation

大语言模型能识别隐含的自杀念头吗?一项实证评估

Tong Li, Shu Yang, Junchao Wu, Jiyao Wei, Lijie Hu, Mengdi Li, Derek F. Wong, Joshua R. Oltmanns, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任人工智能与数据分析实验室) King Abdullah University of Science and Technology(卡瓦尔大学科学与技术大学) Washington University in St.Louis(圣路易斯华盛顿大学) University of Macau(澳门大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了大语言模型在识别隐含自杀念头和提供支持性回应方面的能力,发现现有模型存在显著局限,需更复杂的方法来改进心理健康应用。

Comments Dataset: https://huggingface.co/datasets/babytreecc/Implicit-suicide-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08107 2026-01-14 cs.LG cs.AI cs.SY eess.SY 86%

STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order

STO-RL:通过LLM引导的子目标时间顺序实现稀疏奖励下的离线RL

Chengyang Gu, Yuxin Pan, Hui Xiong, Yize Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 STO-RL通过LLM生成子目标时间顺序,结合潜在奖励塑造,提升稀疏奖励下离线RL的性能与稳定性。

Comments Accepted at International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08003 2026-01-14 cs.CL cs.AI cs.MA 86%

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

LLM Review: 通过盲审同行反馈增强创造性写作

Weiyue Li, Mingxiao Song, Zhenda Shen, Dachuan Zhao, Yunfan Long, Yi Li, Yongce Li, Ruyi Yang, Mengyu Wang

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM Review通过盲审同行反馈机制提升创造性写作,实验显示其优于多智能体基线,并使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08516 2026-01-14 cs.SD cs.CY eess.AS 86%

Robust CAPTCHA Using Audio Illusions in the Era of Large Language Models: from Evaluation to Advances

基于大语言模型时代的稳健CAPTCHA:从评估到进展

Ziqi Ding, Yunfeng Wan, Wei Song, Yi Liu, Gelei Deng, Nan Sun, Huadong Mo, Jingling Xue, Shidong Pan, Yuekang Li

专题命中 评测与基准 :language model(title,abstract);large language model(title)

AI总结 本文提出了一种基于音频 illusion 的新型CAPTCHA方法,通过利用人类听觉机制,有效对抗大语言模型和自动语音识别模型的攻击,显著提升CAPTCHA的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08196 2026-01-14 cs.CL cs.AI cs.CR cs.LO cs.SE 84%

Evaluating Implicit Regulatory Compliance in LLM Tool Invocation via Logic-Guided Synthesis

通过逻辑引导合成评估LLM工具调用中的隐式监管合规性

Da Song, Yuheng Huang, Boqi Chen, Tianshuo Cong, Randy Goebel, Lei Ma, Foutse Khomh

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogiSafetyGen框架,通过逻辑引导合成评估LLM在工具调用中的隐式监管合规性,揭示大模型在安全约束上的不足。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08176 2026-01-14 cs.CL cs.AI 82%

Prompt-Based Clarity Evaluation and Topic Detection in Political Question Answering

基于提示的清晰度评估与政治问答主题检测

Lavanya Prahallad, Sai Utkarsh Choudarypally, Pragna Prahallad, Pranathi Prahallad

机构 * Research Spark Hub Inc. Emerald High School

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了基于提示的清晰度评估与政治问答主题检测,发现思维链提示显著提升清晰度和主题识别准确性,但细粒度逃避检测仍具挑战性。

Comments 6 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11966 2026-01-14 cs.CL cs.AI cs.LG stat.ML 82%

On the Entropy Calibration of Language Models

对语言模型熵校准的研究

Steven Cao, Gregory Valiant, Percy Liang

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了语言模型的熵校准问题,发现随着模型规模增大,校准误差缓慢改善,但截断方法会增加对数损失,理论证明在假设可预测文本熵的情况下,可以减少熵而不增加对数损失。

Comments Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08464 2026-01-14 cs.CV cs.AI 79%

CoMa: Contextual Massing Generation with Vision-Language Models

CoMa:基于视觉-语言模型的上下文体量生成

Evgenii Maslov, Valentin Khrulkov, Anastasia Volkova, Anton Gusarov, Andrey Kuznetsov, Ivan Oseledets

机构 * FusionBrain Lab(融合大脑实验室) Innopolis University(因诺普里斯大学) Institute of Numerical Mathematics(数值数学研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 CoMa提出基于视觉-语言模型的自动化框架,生成基于功能需求和场地背景的建筑体量,引入CoMa-20K数据集并验证了VLMs在生成上下文敏感体量选项中的潜力。

Comments Code and dataset will be released later

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08283 2026-01-14 cs.IR cs.LG 79%

AgriLens: Semantic Retrieval in Agricultural Texts Using Topic Modeling and Language Models

AgriLens:利用主题建模和语言模型进行农业文本的语义检索

Heba Shakeel, Tanvir Ahmad, Tanya Liyaqat, Chandni Saxena

机构 * 3 Dept. of Computer Science \& Applications, Sharda University, Greater Noida, Uttar Pradesh, India 4 The Chinese University of Hong Kong, Hong Kong SAR, China

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 AgriLens通过主题建模和语言模型实现农业文本的可解释语义检索,提供零样本主题标注和高效检索能力。

Comments 8 Pages, 1st workshop on Democratizing GenAI and Scalable NLP with HiPC for Societal Impact; 32nd IEEE International Conference on High Performance Computing, Data, & Analytics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23742 2026-01-14 cs.SE cs.AI 79%

AgenticTCAD: A LLM-based Multi-Agent Framework for Automated TCAD Code Generation and Device Optimization

AgenticTCAD: 基于LLM的多智能体框架用于自动TCAD代码生成与器件优化

Guangxi Fan, Tianliang Ma, Xuguang Sun, Xun Wang, Kain Lu Low, Leilai Shao

机构 * State Key Laboratory of Micro-nano Engineering Science(微纳工程科学国家重点实验室) Micro-nano Engineering Sciences Research Center(微纳工程科学研究中心) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.AI

AI总结 AgenticTCAD通过基于LLM的多智能体框架实现自动TCAD代码生成与器件优化,显著提升设计效率。

Comments Accepted by DATE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09838 2026-01-14 cs.CV cs.AI 79%

ClimateIQA: A New Dataset and Benchmark to Advance Vision-Language Models in Meteorology Anomalies Analysis

ClimateIQA: 一种新的数据集和基准,以推进气象异常分析中的视觉-语言模型

Jian Chen, Peilin Zhou, Yining Hua, Dading Chong, Meng Cao, Yaowei Li, Wei Chen, Bing Zhu, Junwei Liang, Zixuan Yuan

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能研究所,香港科学与技术大学(广州)) Thrust of Data Science and Analytics, The Hong Kong University of Science and Technology (Guangzhou)(数据科学与分析研究所,香港科学与技术大学(广州)) Harvard University(哈佛大学) Peking University(北京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 ClimateIQA通过引入SPOT算法和新型数据集,提升视觉-语言模型在气象异常分析中的准确性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18058 2026-01-14 eess.IV cs.CV 78%

A Pre-trained Foundation Model Framework for Multiplanar MRI Classification of Extramural Vascular Invasion and Mesorectal Fascia Invasion in Rectal Cancer

一种用于直肠癌外侵血管侵袭和腹膜脂肪囊侵袭的多平面MRI分类的预训练基础模型框架

Yumeng Zhang, Shruti Atul Mali, Danial Khan, Sina Amirrajab, Eduardo Ibor-Crespo, Ana Jimenez-Pastor, Gloria Ribas, Silvia Flor-Arnal, Marta Zerunian, Christophe Aube, Luis Marti-Bonmati, Zohaib Salahuddin, Philippe Lambin

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究提出一种基于预训练基础模型的框架,通过频域谐振和多平面融合技术,实现了对直肠癌外侵血管侵袭和腹膜脂肪囊侵袭的自动MRI分类,展示了跨机构的高泛化性能。

Comments 27 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08331 2026-01-14 cs.CL 77%

CLaS-Bench: A Cross-Lingual Alignment and Steering Benchmark

CLaS-Bench: 一种跨语言对齐与引导基准

Daniil Gurgurov, Yusser Al Ghussin, Tanja Baeumel, Cheng-Ting Chou, Patrick Schramowski, Marius Mosbach, Josef van Genabith, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心(CERTAIN)) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) TU Darmstadt(德累斯顿技术大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所(Mila)) McGill University(麦吉尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 CLaS-Bench是首个多语言引导基准,通过评估32种语言中的语言强制行为,验证了残差基于DiffMean方法在跨语言引导中的有效性。

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06477 2026-01-14 cs.CL cs.CY cs.SI 77%

IndRegBias: A Dataset for Studying Indian Regional Biases in English and Code-Mixed Social Media Comments

IndRegBias:一个用于研究印度地区偏见的英文及混合语言社交媒体评论数据集

Debasmita Panda, Akash Anil, Neelesh Kumar Shukla

机构 * Department of Data Science and Engineering, Indian Institute of Science Education and Research(数据科学与工程系,印度科学教育与研究学院) Oracle Industries AI, Oracle Corporation(Oracle人工智能部,Oracle公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出IndRegBias数据集,用于研究印度地区偏见,通过多级标注策略评估LLM和ILM在检测地区偏见及严重性方面的性能。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏