Tagged articles

mixed-effects models

1 articles · Page 1 of 1
Data Party THU
Data Party THU
Sep 9, 2026 · Artificial Intelligence

Online and Off-Policy Learning for Large Action Spaces: Structured Exploration & Optimization

This PhD thesis addresses large action space contextual bandits, proposing mixed-effects and diffusion Thompson sampling for online learning, and structured direct methods, policy-weighted likelihood, exponential smoothing, and PAC-Bayes pessimism for offline learning, showing that action structure, optimizable objectives, and pessimism are crucial for scalable decision-making.

PAC-BayesThompson samplingcontextual bandits
0 likes · 21 min read
Online and Off-Policy Learning for Large Action Spaces: Structured Exploration & Optimization