Tagged articles

contextual bandits

7 articles · Page 1 of 1
Data Party THU
Data Party THU
Sep 9, 2026 · Artificial Intelligence

Online and Off-Policy Learning for Large Action Spaces: Structured Exploration & Optimization

This PhD thesis addresses large action space contextual bandits, proposing mixed-effects and diffusion Thompson sampling for online learning, and structured direct methods, policy-weighted likelihood, exponential smoothing, and PAC-Bayes pessimism for offline learning, showing that action structure, optimizable objectives, and pessimism are crucial for scalable decision-making.

PAC-BayesThompson samplingcontextual bandits
0 likes · 21 min read
Online and Off-Policy Learning for Large Action Spaces: Structured Exploration & Optimization
Data Party THU
Data Party THU
Aug 18, 2026 · Artificial Intelligence

How to Master Online and Offline Policy Learning in Massive Action Spaces

This article reviews a PhD thesis that systematically studies online and offline learning for contextual bandits with huge action spaces, highlighting statistical, computational, and optimization challenges and presenting mixed‑effect Thompson sampling, diffusion priors, structured direct methods, and PAC‑Bayes pessimism as effective solutions.

PAC-BayesThompson samplingcontextual bandits
0 likes · 18 min read
How to Master Online and Offline Policy Learning in Massive Action Spaces
Data Party THU
Data Party THU
Oct 15, 2025 · Artificial Intelligence

Designing Safe, Sample-Efficient, and Robust Reinforcement Learning for Ranking and Diffusion Models

This paper proposes a reinforcement‑learning framework that simultaneously ensures safety, sample efficiency, and robustness, applying a contextual‑bandit perspective to ranking/recommendation systems and text‑to‑image diffusion models, and introduces novel algorithms for safe deployment, variance‑reduced off‑policy estimation, and a LOOP method for generative RL.

Robustnesscontextual banditsdiffusion models
0 likes · 5 min read
Designing Safe, Sample-Efficient, and Robust Reinforcement Learning for Ranking and Diffusion Models
Alimama Tech
Alimama Tech
Sep 8, 2021 · Artificial Intelligence

Deep Uncertainty-Aware Learning (DUAL) for Click‑Through Rate Prediction and Exploration Strategies

The paper presents Deep Uncertainty‑Aware Learning (DUAL), a scalable Bayesian deep‑learning framework that combines a neural feature extractor with a Gaussian‑process prior to model CTR prediction uncertainty, mitigates feedback‑loop bias, and enables confidence‑driven exploration (UCB and Thompson sampling) that improves long‑term utility while preserving accuracy.

Gaussian ProcessOnline AdvertisingUncertainty Modeling
0 likes · 15 min read
Deep Uncertainty-Aware Learning (DUAL) for Click‑Through Rate Prediction and Exploration Strategies
Tencent Advertising Technology
Tencent Advertising Technology
Apr 12, 2021 · Artificial Intelligence

GuideBoot: A Guided Bootstrap Method for Solving Exploration‑Exploitation in Online Advertising

The article explains the exploration‑exploitation dilemma in recommendation systems, introduces the GuideBoot algorithm—an innovative guided bootstrap approach for contextual bandits—describes its Bayesian and non‑Bayesian foundations, presents experimental results on synthetic and real advertising data, and discusses an online learning extension.

Exploration-ExploitationGuideBootOnline Advertising
0 likes · 11 min read
GuideBoot: A Guided Bootstrap Method for Solving Exploration‑Exploitation in Online Advertising
DataFunTalk
DataFunTalk
May 9, 2020 · Artificial Intelligence

Hierarchical Adaptive Contextual Bandits for Resource-Constrained Recommendation (HATCH): A Detailed Review

This article provides a comprehensive review of the HATCH method—Hierarchical Adaptive Contextual Bandits for Resource‑Constraint based Recommendation—detailing its hierarchical architecture, objective function, resource allocation and personalization layers, cumulative regret analysis, experimental results on simulated and real data, and future directions.

Cumulative RegretHATCHcontextual bandits
0 likes · 9 min read
Hierarchical Adaptive Contextual Bandits for Resource-Constrained Recommendation (HATCH): A Detailed Review
DataFunTalk
DataFunTalk
Apr 19, 2020 · Artificial Intelligence

Bandit Algorithms for Recommendation Systems: Context‑Free, Thompson Sampling, and Contextual Approaches

This article explains how multi‑armed bandit methods such as Upper Confidence Bound, Thompson Sampling, and their contextual extensions can address cold‑start, diversity, and bias problems in large‑scale recommendation systems, describing practical update mechanisms, offline evaluation techniques, and deployment experiences at Ctrip.

AIBandit AlgorithmsExploration‑exploitation
0 likes · 15 min read
Bandit Algorithms for Recommendation Systems: Context‑Free, Thompson Sampling, and Contextual Approaches