Workshop Home

KDD 2026 Workshop

Accepted Papers

The 1st International Workshop on AI Data Scientist

18 Accepted Papers 5 Oral Presentations 13 Posters
Presentation Track

Oral Presentations

5 papers
01

CausLab: LLM-Driven Multi-Agent Bayesian Framework for Causal Inference

Chen Wang, Shan Huang, Shichao Han, Yong Wang

PDF not publicly available
02

LLM Agent Driven UBI Policy Experiments: A Case Study of AgentSociety as AI Social Scientist Platform

Che Bai, Yuwei Yan, Jinghua Piao, Yong Li

View PDF
03

SciHorizon-DataEVA: An Agentic System to Scalable AI-Readiness Evaluation of Heterogeneous Scientific Data

Dianyu Liu, Chuan Qin, Xi Chen, Xiaohan Li, Wenxi Xu, Yuyang Wang, Xin Chen, Yuanchun Zhou, Hengshu Zhu

View PDF
04

TacitFlow: Learning Workflow Representations for Tacit-Knowledge-Grounded Machine Learning Engineering Agents

Yushan Jiang, Wenchao Yu, Minyoung Choe, Dongjin Song, Jingchao Ni, Wei Cheng, Haifeng Chen

View PDF
05

DS-Lighting: Making Agent Harnesses Explicit for Data-Science Automation

Fan Liu, Hao Liu

View PDF
Presentation Track

Poster Presentations

13 papers
01

PlannerCritic: A Self-Refining LLM Agent Architecture for End-to-End Data Science Pipelines

Kaustubh S. Bukkapatnam

View PDF
02

Surrogate-Based Prevalence Measurement for Large-Scale A/B Testing

Zehao Xu, Attila Dobi, Tony Paek, Kevin O'Sullivan

View PDF
03

Structured EXPLAIN Feedback Improves SQL Generation with a 4B SLM on Industrial Time-Series Data

Byounghoon Son, Minsung Jung, Hyeonseok Jang, Beomdo Park, Gihun Gil, Junseong Park, Minu Baek, Yeojin Jang, Sangkeum Lee

View PDF
04

Mechanistic Flow Matching for Data-Scarce Scientific Cohorts

Jiyeon Kim, Daehong Min, Minjung Gim, Dongwook Shin, Soon-Sun Kwon

View PDF
05

Toward Self-Evolving Recommenders: Agentic Feature Engineering in High-Throughput Systems

Merwan Barlier, Yuval Dishi, Eliran Abutbul, Jordan Lesjak, Robert Dovžan, Samo Pahor, Yulia Stolin, Assaf Klein, Andraz Tori, Blaž Škrlj

View PDF
06

PRISM: Prompt-Refined In-Context System Modeling for Financial Retrieval

Chun Chet Ng, Jia Yu Lim, Low Wei Zeng

View PDF
07

LLM Priors for Sample-Efficient Industrial Control in Digital-Twin Simulation

Gihun Gil, Minu Baek, Yeojin Jang, Byounghoon Son, Junseong Park, Beomdo Park, Hyeonseok Jang, Minsung Jung, Sangkeum Lee

View PDF
08

Self-Improving Agent Factories for Paper Review: When Constrained Beats Open-Ended

Lele Cao

View PDF
09

DataEvolver: Let Your Data Build and Improve Itself via Goal-Driven Loop Agents

Qisong Zhang, Wenzhuo Wu, Zhuangzhuang Jia, Yunhao Yang, Shuo Zhang, Huayu Zhang, Xianghao Zang, Zhixiang He, Zhongjiang He, Kongming Liang, Zhanyu Ma

PDF not publicly available
10

SynTrail-Tele: A Schema-Grounded Telemetry Synthesis System for Structured Data Reasoning

Yasir Ali Farrukh, Xinye Tang, Yogesh K Roy

View PDF
11

Do LLM-Generated Skills Make Better AI Data Scientists? A Component Ablation Across Data-Science Workflows

Wei-Jung Huang

View PDF
12

sketch-plot: Progressive Editing for Text-to-Image Academic Figures

Yinghao Tang, Yingchaojie Feng, Yupeng Xie, Tingfeng Lan, Jiale Lao, Wei Chen

View PDF
13

Transforming Behavioral Neuroscience Discovery with In-Context Learning and AI-Enhanced Tensor Methods

Paimon Goulart, Jordan Steinhauser, Dawon Ahn, Kylene Shuler, Edward Korzus, Jia Chen, Evangelos E. Papalexakis

View PDF