Tagged articles

PAC-Bayes

2 articles · Page 1 of 1
Data Party THU
Data Party THU
Sep 9, 2026 · Artificial Intelligence

Online and Off-Policy Learning for Large Action Spaces: Structured Exploration & Optimization

This PhD thesis addresses large action space contextual bandits, proposing mixed-effects and diffusion Thompson sampling for online learning, and structured direct methods, policy-weighted likelihood, exponential smoothing, and PAC-Bayes pessimism for offline learning, showing that action structure, optimizable objectives, and pessimism are crucial for scalable decision-making.

PAC-BayesThompson samplingcontextual bandits
0 likes · 21 min read
Online and Off-Policy Learning for Large Action Spaces: Structured Exploration & Optimization
Data Party THU
Data Party THU
Aug 18, 2026 · Artificial Intelligence

How to Master Online and Offline Policy Learning in Massive Action Spaces

This article reviews a PhD thesis that systematically studies online and offline learning for contextual bandits with huge action spaces, highlighting statistical, computational, and optimization challenges and presenting mixed‑effect Thompson sampling, diffusion priors, structured direct methods, and PAC‑Bayes pessimism as effective solutions.

PAC-BayesThompson samplingcontextual bandits
0 likes · 18 min read
How to Master Online and Offline Policy Learning in Massive Action Spaces