arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10293
2506.01442 2026-06-29 cs.AI 版本更新

Agentic Episodic Control

智能体情节控制

Xidong Yang, Wenhao Li, Junjie Sheng, Yun Hua, Haosheng Chen, Chuyun Shen, Xiangfeng Wang

机构 * East China Normal University(华东师范大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University of International Business and Economics(上海对外经贸大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出智能体情节控制(AEC),利用大语言模型增强情节强化学习,通过语义增强器和关键状态识别器提升数据效率和泛化能力,在BabyAI-Text环境中实现2-6倍数据效率提升。

Comments Accepted to Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27330 2026-06-26 cs.CL cs.AI cs.CV cs.LG 新提交

Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning

通过自主经验探索与事后经验利用赋能GUI智能体任务规划

Tianyi Men, Zhuoran Jin, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 提出PEEU方法,通过自主探索环境发现经验并利用事后经验合成严格对齐的高层训练数据,提升小型多模态大语言模型在GUI任务中的规划与跨网站泛化能力。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27287 2026-06-26 cs.AI 新提交

Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection Settings

大型语言模型在自动化简历筛选中的提示注入:单注入与多注入设置

Preet Baxi, Jiannan Xu, Jane Yi Jiang, Stefanus Jasin

AI总结 研究LLM在简历筛选中的提示注入攻击,发现当简历质量同质且注入者少时有效,但随注入者增多效果消失;质量异质时虽平均效果减弱,但偶尔让低质量候选人超越高质量,引发公平问题。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26775 2026-06-26 cs.CL cs.LG 新提交

Evaluation Pitfalls and Challenges in Multimedia Event Extraction

多媒体事件抽取中的评估陷阱与挑战

Philipp Seeberger, Steffen Freisinger, Tobias Bocklet, Korbinian Riedhammer

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡应用技术大学)

AI总结 本文系统分析多媒体事件抽取中的评估陷阱,指出数据处理不一致、任务假设不一致和评估设置过于宽松三大问题,通过严格评估框架下的控制实验揭示评估选择对性能的显著影响。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07407 2026-06-26 cs.CL 版本更新

Training Language Models to Use Prolog as a Tool

训练语言模型以使用Prolog作为工具

Niklas Mellgren, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学)

AI总结 本文探讨通过强化学习训练语言模型使用Prolog进行符号推理,发现正确性与可审计性之间存在权衡,影响模型性能与可解释性。

Comments ACL 2026 Findings (change from last version: corrected year in this comment)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18446 2026-06-26 cs.CL cs.AI 版本更新

ReportLogic: Evaluating Logical Quality in Deep Research Reports

ReportLogic: 评估深度研究报告的逻辑质量

Jujia Zhao, Zhaoxin Huan, Zihan Wang, Xiaolu Zhang, Jun Zhou, Suzan Verberne, Zhaochun Ren

机构 * Leiden Institute of Advanced Computer Science, Leiden University(莱顿先进计算机科学研究所,莱顿大学) Ant Group(蚂蚁集团) CISPA Helmholtz Center for Information Security(信息安全霍普夫中心)

AI总结 提出ReportLogic基准,通过可审计性视角量化报告逻辑质量,包含宏观逻辑、阐述逻辑和结构逻辑三层评估,并训练开源LogicJudge进行可扩展评估。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03247 2026-06-26 cs.CL cs.CY 版本更新

Somatic in the East, Psychological in the West?: Investigating Clinically-Grounded Cross-Cultural Depression Symptom Expression in LLMs

东方躯体化,西方心理化?:探究临床基础下跨文化抑郁症状在LLMs中的表达

Shintaro Sakai, Jisun An, Migyeong Kang, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Sungkyunkwan University(成均馆大学)

AI总结 本研究测试大语言模型(LLMs)是否复现西方抑郁患者报告心理症状、东方患者报告躯体症状的文化模式,发现英语提示下模型未能复现,但东方语言提示改善部分对齐,原因在于模型对文化人物敏感性低及症状层级压倒文化线索。

Comments C3NLP workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25656 2026-06-25 cs.CL cs.AI cs.IR 新提交

Is GraphRAG Needed? From Basic RAG to Graph-/Agentic Solutions with Context Optimization

是否需要GraphRAG?从基础RAG到基于图/智能体的上下文优化解决方案

Long Chen, Ryan Razkenari, Yuxuan Zhou, Yuan Tian, Rahul Ghosh, Venkatesh Pappakrishnan, Disha Ahuja, Vidya Sagar Ravipati

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(亚马逊云科技(AWS)生成式AI创新中心) Cisco Systems, Inc.(思科系统公司)

AI总结 本文提出一个框架,比较常规RAG、GraphRAG、Modular RAG和Agentic RAG在9种标准化场景下的性能,并引入上下文工程方法减少19%-53%的token使用,同时发现检索-生成差距,表明扩展检索未成比例提升生成质量。

Comments Accepted to ACL 2026 GEM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25380 2026-06-25 cs.CL 新提交

A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models

多语言语言模型毒性检测与缓解策略综述

Soham Dan, Himanshu Beniwal, Thomas Hartvigsen

机构 * Scale AI Indian Institute of Technology Gandhinagar(印度理工学院甘地讷格尔分校) University of Virginia(弗吉尼亚大学)

AI总结 综述多语言大模型的毒性检测与缓解方法,包括威胁模型、检测方法(跨语言编码器、翻译流水线等)和缓解策略(数据过滤、偏好调优等),指出语言覆盖不均、文化依赖等挑战。

Comments Accepted to the Findings of ACL, 2026

Journal ref Findings of ACL, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25102 2026-06-25 cs.CL 新提交

Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection

Dream at SemEval-2026 Task 13: SALSA用于单遍机器生成代码检测

Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

机构 * Dream Security Ltd.(Dream Security有限公司)

AI总结 提出SALSA方法,通过自回归语言模型单遍结构化分类,将每个类别映射到专用输出token,结合平衡采样和参数高效微调,在机器生成代码检测任务上达到F1=0.789,远超CodeBERT基线。

Comments Accepted to SemEval-2026, ACL 2026 workshop proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24889 2026-06-25 cs.CL cs.SD 新提交

Graph-Based Phonetic Error Correction of Noisy ASR

基于图的噪声ASR语音错误纠正

Pratik Rakesh Singh, Mohammadi Zaki, Aneesh Mukkamala, Pankaj Wasnik

机构 * Sony Research India(索尼印度研究院)

AI总结 提出G-SPIN框架,结合图神经网络构建音近候选集,并用掩码语言模型和指令调优大语言模型进行上下文重排序,以纠正ASR中结构化的音近错误。

Comments Accepted at ACL Industry Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23129 2026-06-25 cs.LG 版本更新

Polaris: A Gödel Agent Framework for Small Language Models through Experience-Abstracted Policy Repair

Polaris:通过经验抽象策略修复实现小型语言模型的Gödel代理框架

Aditya Kakade, Vivek Srivastava, Shirish Karande

机构 * TCS Research, India(印度TCS研究)

AI总结 Polaris通过经验抽象策略修复实现小型语言模型的Gödel代理框架,通过分析、策略形成、抽象和最小代码修补实现策略更新,提升模型在多个基准测试中的表现。

Comments Accepted to ACL 2026 (Findings). 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05738 2026-06-25 cs.CL 版本更新

MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准

Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)

AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。

Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12843 2026-06-25 cs.LG cs.AI 版本更新

Bias Fitting to Mitigate Length Bias of Reward Model in RLHF

偏差拟合以缓解RLHF中奖励模型的长度偏差

Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出FiMi-RM框架,通过自学习长度与奖励的非线性关系并解耦,有效缓解RLHF中奖励模型因长度偏差导致的奖励破解问题。

Comments 16 pages, 12 figures. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18916 2026-06-25 cs.LG 版本更新

LLM Program Optimization via Retrieval Augmented Search

通过检索增强搜索实现LLM程序优化

Sagnik Anupam, Alexander Shypula, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出检索增强搜索(RAS)方法,利用LLM进行黑盒程序优化,通过检索慢-快程序对引导束搜索,并基于LLM生成的自然语言描述进行上下文检索,显著优于源码检索;同时提出AEGIS方法通过原子编辑提升可解释性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24644 2026-06-24 cs.CL cs.HC 新提交

Measuring User's Mental Models of Speech Translation in Human-AI Collaboration

测量用户在人机协作中对语音翻译的心理模型

HyoJung Han, Nishant Balepur, Jordan Boyd-Graber, Marine Carpuat

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 通过跨语言问答框架研究用户对语音翻译系统的心理模型,发现用户通过实践和源语言知识能更好地预测系统错误,且提供语音转录有助于改善心理模型。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24501 2026-06-24 cs.CL 新提交

UOL@IDEM at BEA 2026 Shared Task 1: Neural Fusion and Feature-Rich Modeling for L1-Aware Vocabulary Difficulty Prediction

UOL@IDEM 在 BEA 2026 共享任务1:面向L1感知词汇难度预测的神经融合与特征丰富建模

Nouran Khallaf, Serge Sharoff

机构 * Centre for Translation, Localisation and Interpreting Studies, School of Languages, Cultures and Societies, University of Leeds(利兹大学语言、文化与社会学院翻译、本地化与口译研究中心) Alexandria University(亚历山大大学)

AI总结 提出一种结合多语言上下文表示与工程化特征的回归模型,用于预测L1感知的词汇难度,在西班牙语、德语和中文上取得优于基线的RMSE结果。

Comments Published at BEA2026, 21st Workshop on Innovative Use of NLP for Building Educational Applications, at ACL, July 2026, San Diego

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24259 2026-06-24 cs.CL cs.AI 新提交

SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization

SURGELLM: 通过任务感知特征门控与类别平衡归一化重新思考多任务评估

Noor Islam S. Mohammad, Ulug Bayazit

机构 * Istanbul Technical University(伊斯坦布尔理工大学)

AI总结 针对异构NLP任务中归纳偏置不匹配、类别不平衡和缺乏外部词汇知识的问题,提出统一Transformer框架SURGELLM,包含手术特征门控、任务条件前缀令牌和实例加权归一化,在四个任务上平均F1提升0.036。

Comments Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), ACL 2026, San Diego, California, USA. Available at https://openreview.net/forum?id=WJCalficPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23881 2026-06-24 cs.CL cs.CV cs.IR 新提交

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

先定位再排序:基于知识的视觉问答中无训练实体识别的再探讨

Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

AI总结 针对知识型视觉问答中实体与证据双重定位瓶颈,提出解耦实体识别与段落排序的无训练IBA框架,利用MLLM候选名称选择与文本重排序器,在降低复杂度同时提升性能。

Comments Accepted by ACL 2026 Findings. Project page https://github.com/VAN-QIAN/ACL26-IBA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23764 2026-06-24 cs.MA cs.AI 新提交

Emergent Relational Order in LLM Agent Societies: From Collective Affect to Authority Stratification

LLM智能体社会中的涌现关系秩序:从集体情感到权威分层

Zhiyuan Ji, Xinyu Chen, Ziqi Dai, Shiyun Tang, Chunyu Wei, Yueguo Chen

机构 * Renmin University of China(中国人民大学) Beihang University(北京航空航天大学) Minzu University of China(民族大学)

AI总结 基于情感控制理论、社会认同理论和涂尔干集体情感,提出CAREB-MAS多智能体框架,通过长期模拟自发再现差序格局的五种核心现象,支持将差序格局解释为社会机制的结构敏感性涌现结果。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23693 2026-06-24 cs.CL cs.IR 新提交

EXPO-SQL: Execution-based Clause-level Policy Optimization for Text-to-SQL

EXPO-SQL:基于执行的子句级策略优化用于文本到SQL

Jaehoon Lee, CheolWon Na, Suyoung Bae, Jin-Seop Lee, Jihyung Lee, YunSeok Choi, Jee-Hyong Lee

机构 * College of Computing and Informatics(计算与信息学院)

AI总结 提出EXPO-SQL方法,通过子句级奖励实现细粒度监督,解决现有强化学习在文本到SQL任务中粗粒度奖励导致学习信号不足的问题,显著提升性能。

Comments 20 pages, 8 figures

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10452 2026-06-24 cs.CL

NOSE: Neural Olfactory-Semantic Embedding with Tri-Modal Orthogonal Contrastive Learning

NOSE:神经嗅觉-语义嵌入与三模态正交对比学习

Yanyi Su, Hongshuai Wang, Zhifeng Gao, Jun Cheng

机构 * State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University, Xiamen, China(厦门大学固体表面物理化学国家重点实验室,化学与化学工程学院,厦门,中国) DP Technology(DP技术) Laboratory of AI for Electrochemistry (AI4EC), Tan Kah Kee Innovation Laboratory (IKKEM), Xiamen, China(电化学人工智能实验室(AI4EC),淡凯实验室(IKKEM),厦门,中国) Institute of Artificial Intelligence, Xiamen University, Xiamen, China(人工智能研究院,厦门大学,厦门,中国)

AI总结 本文提出NOSE框架,通过三模态正交对比学习实现分子结构、受体序列和语言描述的对齐,解决嗅觉路径表示学习的碎片化问题,实现生物基础与语义可解释性的统一。

Comments Accepted to the ACL 2026 Main Conference

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2026, 19615-19647

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20892 2026-06-24 cs.AI 版本更新

Representation Interventions Enable Lifelong Knowledge Memory Control in LLMs

表示干预使大语言模型在终身学习中实现知识记忆控制

Xuyuan Liu, Shengyu Chen, Xinshuai Dong, Yanchi Liu, Xujiang Zhao, Haoyu Wang, Yujun Yan, Haifeng Chen, Zhengzhang Chen

机构 * Dartmouth College(达特茅斯学院) NEC Laboratories America(NEC美国实验室) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出RILKE方法,通过在模型表示空间中进行干预,实现大语言模型的终身知识控制,有效更新知识并保持通用性。

Comments In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: ACL 2026, Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06395 2026-06-24 cs.CL 版本更新

AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages

AfriqueLLM: 数据混合与模型架构如何影响非洲语言的持续预训练

Hao Yu, Tianyi Xu, Michael A. Hedderich, Wassim Hamidouche, Syed Waqas Zamir, David Ifeoluwa Adelani

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(魁北克AI研究所) LMU Munich & Munich Center for Machine Learning(慕尼黑大学及慕尼黑机器学习中心) Microsoft AI for Good Research Lab(微软AI for Good研究实验室)

AI总结 本文通过持续预训练26B tokens,在20种非洲语言上构建了AfriqueLLM模型套件,系统研究了数据组成和模型架构对下游性能的影响,发现数据组成是主要驱动因素,且架构选择比模型规模更重要。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09934 2026-06-24 cs.CL cs.AI

Paying Attention to Deflections: Mining Pragmatic Nuances for Whataboutism Detection in Online Discourse

关注偏移:在线 discourse 中 whataboutism 检测的语用细微差别挖掘

Khiem Phi, Noushin Salek Faramarzi, Chenlu Wang, Ritwik Banerjee

机构 * Department of Computer Science(计算机科学系)

AI总结 本文通过 Twitter 和 YouTube 新数据集,区分 whataboutism、宣传和 tu quoque 囤谬,提出基于注意力权重的负样本挖掘方法,提升检测精度。

Comments 14 pages, 5 figures

Journal ref Findings of the Association for Computational Linguistics ACL. (2024) 12628-12643. https://aclanthology.org/2024.findings-acl.750

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23271 2026-06-23 cs.CL 新提交

Scaling LLM Knowledge Boundaries via Distribution-Optimized Synthesis

通过分布优化合成扩展LLM知识边界

Songze Li, Yarong Lan, Zhongpu Bo, Zhaoyang Wang, Zhiqiang Liu, Yuan Yuan, Chengtao Gan, Menghao Qian, Enpei Niu, Xiaoke Guo, Yuanxiang Liu, Zhaoyan Gong, Xiangjin Hu, Liangyurui Liu, Jingdian Lu, Lei Liang, Jun Zhou, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

AI总结 提出KDoS框架,通过知识密度驱动的三阶段反馈机制优化合成数据的知识分布,显著扩展LLM知识边界,并在多模型和多数据规模上验证了最优分布的稳定性和有效性。

Comments ACL ARR May (EMNLP 2026) Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22783 2026-06-23 cs.IR 新提交

Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible Constraints

打破评估悖论:用计算不可约约束评估高熵搜索

Juntao Wu, Wei Wen, Xianting Huang, Shuai Pang, Ruizhi Qiao, Xing Sun, Ke Wang

AI总结 针对LLM穷举搜索评估中因人类无法创建完整标注导致的悖论,提出VERITAS框架,通过计算不可约约束构造可验证的稀疏答案搜索任务,实现自动生成完美标注测试用例并精确控制难度。

Comments 25 pages, 5 figures, Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22627 2026-06-23 cs.CL cs.AI 新提交

Orthogonal Representation Editing: Decoupling Semantic Entanglement in Batch Knowledge Editing of LLMs

正交表示编辑:解耦大型语言模型批量知识编辑中的语义纠缠

Wenhao Yu, Zhicong Lu, Bo Lv, Fangyin Ma, Kaiwen Wei, Shihao Yang, Nayu Liu

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Kexin Technology(可心科技) University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元) College of Computer Science, Chongqing University(重庆大学计算机学院)

AI总结 针对批量知识编辑中语义表示纠缠导致性能下降的问题,提出正交表示编辑(ORE),通过构建通用语义子空间并对编辑向量施加正交约束来解耦纠缠,并引入门控非线性表示头自适应学习编辑位置,实验表明ORE在跨语言场景中表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22565 2026-06-23 cs.CL cs.AI cs.CV 新提交

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

轻看,重思:多模态思维链推理能做什么和不能做什么

Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文系统探究多模态思维链推理在12个感知与推理任务上的表现,发现CoT对感知任务有副作用,但对数学、科学等多图像推理有效,且现有开源多模态推理模型提升有限,视觉推理仍是瓶颈。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22454 2026-06-23 cs.CL cs.AI 新提交

CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories

机器中的CASPER:LLM生成故事中角色多样性的洞察

Anneliese Brei, Abhisheik Sharma, Nicholas Sanaie, Lu Wang, Snigdha Chaturvedi

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) University of Michigan(密歇根大学)

AI总结 本文借用叙事学定义,从八个维度分析LLM与人类创作故事中角色的刻画,发现两者在角色类型和多样性上既有相似也有差异。

Comments Proceedings of ACL, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏