arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-16 至 2026-01-16 共收录 186 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 34 篇

2601.10712 2026-01-16 cs.CL cs.AI 73%

MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching

MatchTIR: 通过双图匹配实现工具集成推理的细粒度监督

Changle Qu, Sunhao Dai, Hengyi Cai, Jun Xu, Shuaiqiang Wang, Dawei Yin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MatchTIR通过双图匹配实现细粒度监督,提升工具集成推理在长周期多轮任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10173 2026-01-16 cs.CR cs.AI cs.CL 73%

ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack

ReasAlign: 基于推理增强的安全对齐以抵御提示注入攻击

Hao Li, Yankai Yang, G. Edward Suh, Ning Zhang, Chaowei Xiao

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(NVIDIA公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReasAlign通过结构化推理和测试时缩放机制,有效防御提示注入攻击,实现安全与效用的最佳平衡。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10094 2026-01-16 cs.CV cs.AI cs.LG 73%

V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation

V-Zero:基于零标注的自改进多模态推理

Han Wang, Yi Yang, Jingyuan Hu, Minfeng Zhu, Wei Chen

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 V-Zero通过自改进机制在无需人工标注的情况下提升多模态模型的视觉数学推理和通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09709 2026-01-16 cs.LG cs.CL cs.CY 73%

Social Determinants of Health Prediction for ICD-9 Code with Reasoning Models

基于推理模型的ICD-9代码社会决定因素预测

Sharim Khan, Paul Landes, Adam Cross, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois Chicago Peoria(伊利诺伊大学芝加哥分校皮奥里亚分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用推理模型和传统大语言模型,在MIMIC-III数据集上对医院入院的多标签社会决定因素ICD-9代码进行分类,实现了89%的F1分数,并发现139次入院中缺失的SDoH代码。

Comments Published as part of Machine Learning for Health (ML4H) 2025 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23281 2026-01-16 cs.AI cs.CL 73%

MathArena: Evaluating LLMs on Uncontaminated Math Competitions

MathArena: 在无污染数学竞赛中评估大语言模型

Mislav Balunović, Jasper Dekoninck, Ivo Petrov, Nikola Jovanović, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) INSAIT

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MathArena通过评估数学竞赛中的LLM,揭示了模型在推理和证明写作上的能力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10581 2026-01-16 cs.AI cs.IR 70%

From Single to Multi-Agent Reasoning: Advancing GeneGPT for Genomics QA

从单 agent 到多 agent 推理:提升 GeneGPT 的基因组 QA 能力

Kimia Abedini, Farzad Shami, Gianmaria Silvello

机构 * University of Padua, Italy(帕多瓦大学,意大利) Aalto University, Finland(阿alto大学,芬兰)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GenomAgent通过多 agent框架提升基因组 QA 能力,实现对复杂基因组查询的高效处理,并在多个任务中超越现有系统。

Comments Accepted paper by the 48th European Conference on Information Retrieval (ECIR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10342 2026-01-16 cs.AI 70%

C-GRASP: Clinically-Grounded Reasoning for Affective Signal Processing

C-GRASP:基于临床的感知信号处理推理

Cheng Lin Cheng, Ting Chuan Lin, Chai Kai Chang

机构 * Department of Physics National Central University(物理系国立中央大学) Center for Education National Central University(教育中心国立中央大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 C-GRASP通过临床基础推理提升情感信号处理的准确性与临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10254 2026-01-16 cs.AI 70%

NoReGeo: Non-Reasoning Geometry Benchmark

NoReGeo:非推理几何基准

Irina Abdullaeva, Anton Vasiliuk, Elizaveta Goncharova, Temurbek Rahmatullaev, Zagorulko Ivan, Maxim Kurkin, Andrey Kuznetsov

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NoReGeo基准评估LLMs在不依赖推理或代数计算的情况下对几何问题的理解能力,发现即使先进模型在二分类任务中也仅达65%准确率,揭示了当前LLMs在几何认知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10064 2026-01-16 cs.CL 70%

Long-Chain Reasoning Distillation via Adaptive Prefix Alignment

通过自适应前缀对齐实现长链推理蒸馏

Zhenghao Liu, Zhuoyang Wu, Xinze Li, Yukun Yan, Shuo Wang, Zulong Chen, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系) Alibaba Group, China(阿里巴巴集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过自适应前缀对齐方法提升学生模型的推理能力,有效蒸馏教师生成的长推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09668 2026-01-16 cs.CV 67%

STEP3-VL-10B Technical Report

STEP3-VL-10B 技术报告

Ailin Huang, Chengyuan Yao, Chunrui Han, Fanqi Wan, Hangyu Guo, Haoran Lv, Hongyu Zhou, Jia Wang, Jian Zhou, Jianjian Sun, Jingcheng Hu, Kangheng Lin, Liang Zhao, Mitt Huang, Song Yuan, Wenwen Qu, Xiangfeng Wang, Yanlin Lai, Yingxiu Zhao, Yinmin Zhang, Yukang Shi, Yuyang Chen, Zejia Weng, Ziyang Meng, Ang Li, Aobo Kong, Bo Dong, Changyi Wan, David Wang, Di Qi, Dingming Li, En Yu, Guopeng Li, Haiquan Yin, Han Zhou, Hanshan Zhang, Haolong Yan, Hebin Zhou, Hongbo Peng, Jiaran Zhang, Jiashu Lv, Jiayi Fu, Jie Cheng, Jie Zhou, Jisheng Yin, Jingjing Xie, Jingwei Wu, Jun Zhang, Junfeng Liu, Kaijun Tan, Kaiwen Yan, Liangyu Chen, Lina Chen, Mingliang Li, Qian Zhao, Quan Sun, Shaoliang Pang, Shengjie Fan, Shijie Shang, Siyuan Zhang, Tianhao You, Wei Ji, Wuxun Xie, Xiaobo Yang, Xiaojie Hou, Xiaoran Jiao, Xiaoxiao Ren, Xiangwen Kong, Xin Huang, Xin Wu, Xing Chen, Xinran Wang, Xuelin Zhang, Yana Wei, Yang Li, Yanming Xu, Yeqing Shen, Yuang Peng, Yue Peng, Yu Zhou, Yusheng Li, Yuxiang Yang, Yuyang Zhang, Zhe Xie, Zhewei Huang, Zhenyi Lu, Zhimin Fan, Zihui Cheng, Daxin Jiang, Qi Han, Xiangyu Zhang, Yibo Zhu, Zheng Ge

机构 * Multimodal Intelligence Team(多模态智能团队)

专题命中 推理与问题求解 :foundation model(abstract);post-training(abstract)

AI总结 STEP3-VL-10B 是一个轻量级开源基础模型,通过统一预训练和强化学习策略,在紧凑规模下实现多模态智能,超越大规模模型并在复杂推理任务中表现优异。

Comments 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02064 2026-01-16 cs.CV 67%

RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video

RTV-Bench: 通过实时视频对多模态大语言模型的连续感知、理解和推理进行基准测试

Shuhang Xun, Sicheng Tao, Jungang Li, Yibo Shi, Zhixin Lin, Zhanhui Zhu, Yibo Yan, Hanqian Li, Linghao Zhang, Shikang Wang, Yixin Liu, Hanbo Zhang, Ying Ma, Xuming Hu

机构 * HIT(哈尔滨工业大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) XJTU(西安交通大学) SDU(山东大学) CityU(城市大学) HUST(华中科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 RTV-Bench通过实时视频对多模态大语言模型的连续感知、理解和推理能力进行细粒度基准测试,揭示了实时模型在长时段视频处理中的性能优势与局限。

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track;

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09667 2026-01-16 cs.AI cs.CL 62%

Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning

协同多智能体测试时间强化学习用于推理

Zhiyuan Hu, Yunhai Hu, Juncheng Liu, Shuyue Stella Li, Yucheng Wang, Zhen Xu, See-Kiong Ng, Anh Tuan Luu, Xinxing Xu, Bryan Hooi, Cynthia Breazeal, Hae Won Park

机构 * MIT(麻省理工学院) NUS(新加坡国立大学) NYU(纽约大学) Microsoft(微软) Columbia(哥伦比亚大学) NTU(国立科技大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 MATTRL通过在推理阶段注入结构化文本经验,提升多智能体在医学、数学和教育等领域的推理准确性,比多智能体基线提升3.67%,比单智能体基线提升8.67%。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09771 2026-01-16 cs.AI 57%

PCN-Rec: Agentic Proof-Carrying Negotiation for Reliable Governance-Constrained Recommendation

PCN-Rec: 基于代理的证明携带协商用于可靠约束下的推荐

Aradhya Dixit, Shreem Dixit

机构 * Wake Technical Community College(韦克技术社区学院) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 PCN-Rec通过代理证明携带协商机制,在满足治理约束的同时提升推荐可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09770 2026-01-16 cs.AI 57%

GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents

GUI-Eyes: 用于GUI代理视觉接地的工具增强感知

Chen Chen, Jiawei Shao, Dakuan Lu, Haoyi Hu, Xiangcheng Liu, Hantao Yao, Wu Liu

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 GUI-Eyes通过分阶段策略推理和细粒度奖励反馈实现工具感知主动感知,显著提升GUI代理的接地准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10093 2026-01-16 cs.SE 50%

Mark My Works Autograder for Programming Courses

标记我的作品编程课程自动评分系统

Yiding Qiu, Seyed Mahdi Azimi, Artem Lensky

专题命中 推理与问题求解 :LLM(abstract)

AI总结 Mark My Works通过结合传统单元测试与大语言模型生成解释,为编程课程提供更详细的自动评分和教学反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 45 篇

2601.10122 2026-01-16 cs.CL cs.AI cs.HC 91%

Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends

由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势

Ye Wang, Jiaxing Chen, Hongjiang Xiao

机构 * Communication University of China(中国传媒大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10660 2026-01-16 cs.CL 89%

Detecting Winning Arguments with Large Language Models and Persuasion Strategies

利用大型语言模型和说服策略检测获胜论点

Tiziano Labruna, Arkadiusz Modzelewski, Giorgio Satta, Giovanni Da San Martino

机构 * University of Padua(帕多瓦大学) Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文利用大型语言模型和说服策略分析论证文本,通过多策略评分方法提升说服力预测,并公开发布主题注释数据集以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10194 2026-01-16 quant-ph physics.chem-ph 89%

Autonomous Quantum Simulation through Large Language Model Agents

通过大语言模型代理实现自主量子模拟

Weitang Li, Jiajun Ren, Lixue Cheng, Cunxi Gong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用大语言模型代理实现自主量子模拟,通过上下文学习和多代理架构提升模拟效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09972 2026-01-16 cs.AI 88%

Chinese Labor Law Large Language Model Benchmark

中国劳动法大语言模型基准

Zixun Lan, Maochun Xu, Yifan Ren, Rui Wu, Jianghui Zhou, Xueyang Cheng, Jianan Ding Ding, Xinheng Wang, Mingmin Chi, Fei Ma

机构 * Department of Mechatronics and Robotics, Xi’an Jiaotong–Liverpool University(机械与机器人系,西安交通大学利物浦大学) Department of Applied Mathematics, Xi’an Jiaotong–Liverpool University(应用数学系,西安交通大学利物浦大学) Hansheng Lawyers Building(翰盛律师事务所) Suzhou Gewu Digital Technology Co., Ltd.(苏州葛武数字技术有限公司) Kenneth Wang School of Law, Soochow University(肯尼斯·王法学院,苏州大学) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出LabourLawLLM和LabourLawBench,专门针对中国劳动法任务,通过精确的法律知识和复杂推理提升法律AI的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09833 2026-01-16 cs.CL 88%

Stable and Explainable Personality Trait Evaluation in Large Language Models with Internal Activations

在大型语言模型中利用内部激活实现稳定且可解释的人格特质评估

Xiaoxu Ma, Xiangbo Zhang, Zhenyu Weng

机构 * Georgia Institute of Technology(佐治亚理工学院) South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出PVNI方法,通过内部激活提取人格向量并插值得分,实现LLMs中稳定且可解释的人格特质评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10460 2026-01-16 cs.CL cs.AI cs.CY cs.LG 88%

Contextual StereoSet: Stress-Testing Bias Alignment Robustness in Large Language Models

上下文立体集:在大型语言模型中压力测试偏见对齐的鲁棒性

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology, Allahabad (IIITA)(印度信息与技术研究所(Allahabad)) National Institute of Electronics and Information Technology (NIELIT)(国家电子与信息技术研究所)

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 上下文立体集通过压力测试大型语言模型在不同上下文中的偏见对齐鲁棒性,揭示固定条件测试的偏见分数可能无法推广。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09905 2026-01-16 cs.SE cs.CL 87%

Self-reflection in Automated Qualitative Coding: Improving Text Annotation through Secondary LLM Critique

在自动化定性编码中的自我反思:通过二次LLM批评提升文本标注

Zackary Okun Dunivin, Mobina Noori, Seth Frey, Curtis Atkinson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过二次LLM批评提升文本标注精度,减少错误率并提高分类器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20721 2026-01-16 cs.CL cs.AI cs.HC 86%

User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios

用户感知与代理LLM评判:隐私与帮助性在隐私敏感场景中的LLM响应

Xiaoyuan Wu, Roshni Kaushik, Wenkai Li, Lujo Bauer, Koichi Onoue

机构 * Fujitsu Research of America Inc.(富士通美国研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现用户对LLM响应的隐私和帮助性感知与代理LLM评判存在显著差异,需加强用户为中心的评估以提升隐私保护与实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05465 2026-01-16 cs.AI cs.CL 86%

VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models

VAL-Bench:信念一致性作为语言模型价值观对齐的度量标准

Aman Gupta, Denny O'Shea, Fazl Barez

机构 * MasterClass University of Oxford(牛津大学) WhiteBox Martian

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 VAL-Bench通过评估语言模型在现实价值相关提示中的信念一致性,提出了一种衡量价值观对齐的新基准,揭示了不同模型在一致性上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02097 2026-01-16 cs.CL cs.AI 86%

JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation

JudgeAgent: 超越静态基准的面向知识驱动和动态LLM评估

Zhichao Shi, Xuhui Jiang, Chengjin Xu, Cangli Yao, Shengjia Ma, Yinghan Shen, Zixuan Li, Jian Guo, Yuanzhuo Wang

机构 * DataArc Tech Ltd.(DataArc科技有限公司) IDEA Research, International Digital Economy Academy(国际数字经济学院IDEA研究所) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科学院) State Key Lab of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 JudgeAgent通过知识驱动和动态评估框架,解决LLM评估中知识覆盖不足和难度不匹配的问题,实现更全面的评估和模型优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10025 2026-01-16 cs.AI 85%

Structured Personality Control and Adaptation for LLM Agents

结构化人格控制与适应用于大语言模型代理

Jinpeng Wang, Xinyu Jia, Wei Wei Heng, Yuquan Li, Binbin Shi, Qianlei Chen, Guannan Chen, Junxia Zhang, Yuyu Yin

机构 * Key Laboratory of Complex Systems Modeling and Simulation of Ministry of Education(教育部复杂系统建模与仿真重点实验室) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于荣格心理学类型模型的结构化人格控制框架,通过协调、强化补偿和反思机制实现LLM人格的细腻表达与动态适应,提升人机交互中的自然代理设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09717 2026-01-16 cs.CL cs.AI 84%

SALP-CG: Standard-Aligned LLM Pipeline for Classifying and Grading Large Volumes of Online Conversational Health Data

SALP-CG:面向在线医疗对话数据分类与分级的标准对齐大语言模型流水线

Yiwei Yan, Hao Li, Hua He, Gong Kai, Zhengyi Yang, Guanfeng Liu

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) School of Mathematics and Statistics, Shandong University of Technology, China(山东理工大学数学与统计学院) Digital Intelligence Center, Fuzhou University Affiliated Provincial Hospital, China(福州市附属省医院数字智能中心) School of Computer Science and Engineering, UNSW, Australia(新南威尔士大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SALP-CG通过统一标准和自动化方法,实现在线医疗对话数据的分类与敏感性分级,提升健康数据治理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10458 2026-01-16 cs.HC cs.LG stat.CO 83%

LangLasso: Interactive Cluster Descriptions through LLM Explanation

LangLasso:通过LLM解释实现交互式聚类描述

Raphael Buchmüller, Dennis Collaris, Linhao Meng, Angelos Chatzimparmpas

机构 * University of Konstanz(康斯坦茨大学) Utrecht University(乌得勒支大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LangLasso通过LLM生成交互式自然语言描述,使非专家也能理解聚类结构并整合外部知识。

Comments This manuscript is accepted for publication in VIS 2025 VISxGenAI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18454 2026-01-16 cs.CL cs.AI cs.LG 82%

Fairness Definitions in Language Models Explained

语言模型中的公平性定义解析

Zhipeng Yin, Zichong Wang, Avash Palikhe, Wenbin Zhang

机构 * Florida International University(佛罗里达国际大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统解析了语言模型中公平性定义的分类与应用,介绍了现有公平性概念及新分类方法,通过实验探讨其实际影响,旨在推动公平性研究的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10646 2026-01-16 cs.SE cs.AI 81%

CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance

CodeAssistBench (CAB): 用于多轮聊天式代码协助的数据库与基准测试

Myeongsoo Kim, Shweta Garg, Baishakhi Ray, Varun Kumar, Anoop Deoras

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 CodeAssistBench首次提出多轮、项目导向的编程协助基准测试,揭示当前LLM在真实项目情境中的性能差距。

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏