Google is proud to be a Diamond Sponsor for the third annual Conference on Language Modeling (COLM 2026), hosted at the Hilton Union Square in San Francisco, CA, USA from October 6–9, 2026. Dedicated to the study of language modeling, broadly defined, COLM brings together an interdisciplinary community of researchers focused on understanding, improving, and critiquing the development of language model technology. Researchers across Google, including Google Research and Google DeepMind, are excited to share 28 accepted papers, participate in 16 workshops, join a main-stage panel discussion, and host interactive demo sessions throughout the conference.
Attending COLM 2026 in person? Stop by the Google booth (#107) to learn more about how we’re actively pursuing the latest innovations in language modeling, reasoning, multimodal understanding, agentic systems, and responsible AI. For real-time updates on conference activities, including live booth demos and careers sessions, follow @GoogleResearch on X and visit the Google Research LinkedIn page.
Continue below to learn more about how Google researchers are engaged at COLM 2026 (Google affiliations highlighted in bold, * Indicates work done while at Google).
Please note that all scheduled session times are listed in Pacific Daylight Time (PDT).
Wed, Oct 7 | 1:00PM — 2:30PM, Grand Ballroom
Grounded, Self-Improving Multi-Agent Systems for Complex Real-World Tasks
Yale Song, Jinsung Yoon, Tomas Pfister
Beyond the Rosetta Stone: Unification Forces in Generalization Dynamics
Carter Blum, Katja Filippova, Ann Yuan, Asma Ghandeharioun, Julian Zimmert, Fred Zhang, Jessica Hoffmann, Tal Linzen, Martin Wattenberg, Lucas Dixon, Mor Geva
Oral: Wed, Oct 7 | 4:00PM — 4:15PM, Grand Ballroom (Oral Session 4)
Poster: Wed, Oct 7 | 4:30PM — 6:30PM, Imperial Ballroom (Poster Session 4, #4)
A Unified Model and Document Representation for On-Device Retrieval-Augmented Generation
Julian Killingback*, Ofer Meshi, Henry Li, Hamed Zamani, Maryam Karimzadehgan
Analysis of Optimality of Large Language Models on Planning Problems
Bernd Bohnet, Michael C. Mozer, Kevin Swersky, Wil Cunningham, Aaron Parisi, Kathleen Kenealy, Noah Fiedel
AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
Xilin Jiang, Qiaolin Wang, Junkai Wu, Xiaomin He, Zhongweiyang Xu, Yinghao Ma, Minshuo Piao, Kaiyi Yang, Xiuwen Zheng, Riki Shimizu, Yicong Chen, Arsalan Firoozi, Gavin Mischler, Sukru Samet Dindar, Richard Antonello, Linyang He, Tsun-An Hsieh, Xulin Fan, Yulun Wu, Yuesheng Ma, Chaitanya Amballa, Weixiong Chen, Jiarui Hai, Ruisi Li, Vishal Choudhari, Cong Han, Yinghao Aaron Li, Adeen Flinker, Mounya Elhilali, Emmanouil Benetos, Mark A. Hasegawa-Johnson, Romit Roy Choudhury, Nima Mesgarani
Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning
Chaoran Chen, Dayu Yuan, Peter Kairouz
BigCodeArena: A Platform for Executable Code Generation Evaluation
Terry Yue Zhuo, Xiaolong Jin, Hange Liu, Juyong Jiang, Tianyang Liu, Chen Gong, Bhupesh Bishnoi, Vaisakhi Mishra, Marek Šuppa, Noah Ziems, Saiteja Utpala, Ming Xu, Guangyu Song, Kaixin Li, Yuhan Cao, Bo Liu, Zheng Liu, Sabina Abdurakhmanova, Wenhao Yu, Mengzhao Jia, Jihan Yao, Kenneth Hamilton, Kumar Shridhar, Vu Minh Chien, Dingmin Wang, Jiawei Liu, Zijian Wang, Qian Liu, Binyuan Hui, Meg Risdal, Ahsen Khaliq, Atin Sood, Zhenchang Xing, Wasi Uddin Ahmad, John C. Grundy, David Lo, Banghua Zhu, Xiaoning Du, Torsten Scholak, Leandro von Werra
Budget-Aware Tool Use Enables Effective Agent Scaling
Tengxiao Liu*, Zifeng Wang, Jin Miao, I-Hung Hsu, Jun Yan, Jiefeng Chen, Rujun Han, Fangyuan Xu, Yanfei Chen, Ke Jiang, Samira Daruki, Yi Liang, William Yang Wang, Tomas Pfister, Chen-Yu Lee
Co-Director: Agentic Generative Video Storytelling
Yale Song, Yiwen Song, Nick Losier, Nathan Hodson, Ye Jin, Rhyard Zhu, Yan Xu, Daniel Vlasic, Carina Claassen, Jasmine Leon, Khanh G. LeViet, Zack Chomyn, Joe Timmons, Brett Slatkin, Scott Penberthy, Tomas Pfister
Decoupling Planning and Control for Instructable Agents
Zineng Tang, Kelsey R Allen*, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr
Do Depth-Grown Models Overcome the Curse of Depth? An In-Depth Analysis
Ferdinand Kapl, Emmanouil Angelis, Tobias Höppe, Kaitlin Maile, Johannes von Oswald, Nino Scherrer, Stefan Bauer
Estimating Near-Verbatim Extraction Risk in Language Models with Decoding-Constrained Beam Search
A. Feder Cooper, Mark Lemley, Christopher De Sa, Lea Duesterwald, Allison Casasola, Jamie Hayes, Katherine Lee, Daniel E. Ho, Percy Liang
Fine-Tuning Was Not Broken but Diffuse: Precise Knowledge Editing via Projected Error Signals
Shahar Katz, Lior Wolf, Avi Caciularu
Identity, Cooperation and Framing Effects within Groups of Real and Simulated Humans
Suhong Moon, Minwoo Kang, Joseph Suh, Mustafa Safdari, John Canny
Improving Latent Generalization Using Test-time Compute
Arslan Chaudhry, Sridhar Thiagarajan, Andrew Lampinen*
Learning Steerable Clarification Policies with Collaborative Self-play
Jonathan Berant, Maximillian Chen, Adam Fisch, Reza Aghajani*, Fantine Eri Huot, Mirella Lapata, Jacob Eisenstein
Learning to Learn from Language Feedback with Social Meta-Learning
Jonathan Cook, Diego Antognini, Martin Klissarov, Claudiu Cristian Musat, Edward Grefenstette
MAPLE: Metadata Augmented Private Language Evolution
Eli Chien, Yuzheng Hu*, Ryan McKenna, Shanshan Wu, Zheng Xu*, Peter Kairouz
MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models
Haohang Huang, Xuan Lu, Mingyi Su, Xuan Zhang, Ziyan Jiang, Ping Nie, Kai Zou, Tomas Pfister, Wenhu Chen, Wei Zhang, Xiaoyu Shen, Rui Meng
MT-PINGEVAL: Evaluating Multi-Turn Collaboration with Private Information Games
Jacob Eisenstein, Fantine Eri Huot, Adam Fisch, Jonathan Berant, Mirella Lapata
PaperOrchestra: A Multi-Agent Framework for Automated AI Research Paper Writing
Yiwen Song, Yale Song, Tomas Pfister, Jinsung Yoon
Penalizing Length: Uncovering Systematic Bias in Quality Estimation Metrics
Yilin Zhang, Wenda Xu, Zhongtao Liu, Tetsuji Nakagawa, Markus Freitag
PolicyBank: Evolving Policy Understanding for LLM Agents
Jihye Choi*, Jinsung Yoon, Long T. Le, Somesh Jha, Tomas Pfister
Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs
Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona, Idan Szpektor, Arman Cohan
Steering LLMs for Culturally Localized Generation
Simran Khanuja*, Hongbin Liu, Shujian Zhang, John Lambert, Mingqing Chen, Rajiv Mathews, Lun Wang
StoryScope: Investigating Idiosyncrasies in AI Fiction
Jenna Russell, Rishanth Rajendhran, Mohit Iyyer, John Wieting
The Illusion of Stochasticity in LLMs
Xiangming Gu*, Soham De, Michalis Titsias, Larisa Markeeva, Petar Veličković, Razvan Pascanu
Thinking to Recall: How Reasoning Unlocks Parametric Knowledge in LLMs
Zorik Gekhman, Roee Aharoni, Eran Ofek, Mor Geva, Roi Reichart, Jonathan Herzig
To See the Unseen: On the Generalization Ability of Transformers in Symbolic Reasoning
Nevena Lazić, Liam H Fowl*, András György, Csaba Szepesvári
Fri, Oct 9 | 8:30AM — 6:00PM
Actionable Interpretability
Organizers: Ian Tenney
Fri, Oct 9 | 8:30AM — 5:30PM
AdvML-Frontiers × CoTMA: From Model Security to Compositional Threats in Multi-Agent AI Systems
Speakers: Somesh Jha, Eugene Bagdasarian | Panelist: Eugene Bagdasarian | Organizers: Yao Qin, Baharan Mirzasoleiman
Fri, Oct 9 | 8:30AM — 6:00PM
Agent Behavior
Speakers: Natasha Jaques
Fri, Oct 9 | 8:30AM — 5:30PM
AI Measurement Science: Toward Rigorous AI Evaluation
Organizers: Berivan Isik
Fri, Oct 9 | 9:00AM — 6:00PM
Context Beyond the Window: Persistent Knowledge in Language Models
Organizers: Emiliano Penaloza, Sharut Gupta, Benjamin Thérien, Guillaume Lajoie, Martin Klissarov
Fri, Oct 9 | 9:00AM — 4:50PM
Generative AI for the World: The First Workshop on Globalizing Tasks, Evaluations, and Systems
Speakers: Vinodkumar Prabhakaran | Organizers: Michael Saxon
Fri, Oct 9 | 9:00AM — 5:30PM
Human-Centered Privacy and Security for Language Models
Speakers: Helen Nissenbaum, Nina Taft, Florian Tramèr
Fri, Oct 9 | 8:30AM — 6:00PM
Learning from Situated and Embodied Interaction
Speakers: Been Kim
Fri, Oct 9 | 8:45AM — 5:45PM
Lifelong Agent: Learning, Aligning, Evolving
Speakers: Natasha Jaques
Fri, Oct 9 | 9:00AM — 5:30PM
LLM/VLM Deployment Opportunities and Risks in Healthcare
Panelists: Yongshuo Zong
Fri, Oct 9 | 9:00AM — 6:00PM
Methods and Opportunities at Small Scale (MOSS)
Organizers: Abhishek Panigrahi
Fri, Oct 9 | 9:00AM — 6:20PM
Non-Autoregressive Language Models for Fast and Flexible Text Generation
Organizers: Arnaud Doucet
Fri, Oct 9 | 8:45AM — 5:05PM
Responsibly Enabling Data for Foundation Models
Organizers: Kamalika Chaudhuri, Natalia Ponomareva
Fri, Oct 9 | 8:45AM — 6:00PM
Scientific Understanding of Foundation Models
Organizers: Hanlin Zhang
Fri, Oct 9 | 9:00AM — 5:15PM
Social Sim'26: Fidelity in Applications
Speakers: Logan Cross
Fri, Oct 9 | 8:30AM — 6:00PM
Tokenization
Organizers: Elizabeth Salesky