2026

Efficient Offline Learning of Ranking Policies via Top-k Policy Decomposition

Ren Kishimoto*, Koichi Tanaka*, Haruka Kiyohara, Yusuke Narita, Nobuyuki Shimizu, Yasuo Yamamoto, Yuta Saito (* equal contribution)

In Proceedings of 35th ACM International Conference on Knowledge and Information Management (CIKM) 2026 (Acceptance Rate=27%)

Efficient Offline Learning of Ranking Policies via Top-k Policy Decomposition

Ren Kishimoto*, Koichi Tanaka*, Haruka Kiyohara, Yusuke Narita, Nobuyuki Shimizu, Yasuo Yamamoto, Yuta Saito (* equal contribution)

In Proceedings of 35th ACM International Conference on Knowledge and Information Management (CIKM) 2026

Ad Asset Portfolio Optimization via Policy Learning

Koichi Tanaka, Zhi Wang, Masahiro Asami, Kota Ishizuka, Kosuke Kawakami, Yuta Saito

KDD 2026 Workshop on AdKDD 2026

Ad Asset Portfolio Optimization via Policy Learning

Koichi Tanaka, Zhi Wang, Masahiro Asami, Kota Ishizuka, Kosuke Kawakami, Yuta Saito

KDD 2026 Workshop on AdKDD 2026

Combinatorial Allocation Bandits with Nonlinear Arm Utility

Yuki Shibukawa, Koichi Tanaka, Yuta Saito, Shinji Ito

ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning 2026

Combinatorial Allocation Bandits with Nonlinear Arm Utility

Yuki Shibukawa, Koichi Tanaka, Yuta Saito, Shinji Ito

ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning 2026

Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies

Koichi Tanaka, Kazuki Kawamura, Takanori Muroi, Yusuke Narita, Yuki Sasamoto, Kei Tateno, Takuma Udagawa, WeiWei.du, Yuta Saito

In Proceedings of the Fourteenth International Conference on Learning Representations (ICLR) 2026 (Acceptance Rate=28%)

Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies

Koichi Tanaka, Kazuki Kawamura, Takanori Muroi, Yusuke Narita, Yuki Sasamoto, Kei Tateno, Takuma Udagawa, WeiWei.du, Yuta Saito

In Proceedings of the Fourteenth International Conference on Learning Representations (ICLR) 2026

Beyond Match Maximization and Fairness: Retention-Optimized Two-Sided Matching

Ren Kishimoto, Rikiya Takehi, Koichi Tanaka, Masahiro Nomura, Riku Togashi, Yoji Tomita, Yuta Saito

In Proceedings of the Fourteenth International Conference on Learning Representations (ICLR) 2026 (Acceptance Rate=28%)

Beyond Match Maximization and Fairness: Retention-Optimized Two-Sided Matching

Ren Kishimoto, Rikiya Takehi, Koichi Tanaka, Masahiro Nomura, Riku Togashi, Yoji Tomita, Yuta Saito

In Proceedings of the Fourteenth International Conference on Learning Representations (ICLR) 2026

Off-Policy Learning with Limited Supply

Koichi Tanaka*, Ren Kishimoto*, Bushun Kawagishi, Yusuke Narita, Yasuo Yamamoto, Nobuyuki Shimizu, Yuta Saito (* equal contribution)

In Proceedings of the ACM Web Conference 2026 (TheWebConf) 2026 (Acceptance Rate=20.1%)

Off-Policy Learning with Limited Supply

Koichi Tanaka*, Ren Kishimoto*, Bushun Kawagishi, Yusuke Narita, Yasuo Yamamoto, Nobuyuki Shimizu, Yuta Saito (* equal contribution)

In Proceedings of the ACM Web Conference 2026 (TheWebConf) 2026

Objective-Driven Calibrated Recommendations

Rikiya Takehi*, Koichi Tanaka*, Ren Kishimoto, Masahiro Nomura, Riku Togashi, Yuta Saito (* equal contribution)

Under review. 2026

Objective-Driven Calibrated Recommendations

Rikiya Takehi*, Koichi Tanaka*, Ren Kishimoto, Masahiro Nomura, Riku Togashi, Yuta Saito (* equal contribution)

Under review. 2026

2024

Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits

Tatsuhiro Shimizu*, Koichi Tanaka*, Ren Kishimoto, Haruka Kiyohara, Masahiro Nomura, Yuta Saito (* equal contribution)

In Proceedings of the 18th ACM Conference on Recommender Systems (RecSys) 2024 Oral (Acceptance Rate=22%)

Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits

Tatsuhiro Shimizu*, Koichi Tanaka*, Ren Kishimoto, Haruka Kiyohara, Masahiro Nomura, Yuta Saito (* equal contribution)

In Proceedings of the 18th ACM Conference on Recommender Systems (RecSys) 2024 Oral

Efficient Offline Learning of Ranking Policies via Top-k Policy Decomposition

Ren Kishimoto*, Koichi Tanaka*, Haruka Kiyohara, Yusuke Narita, Nobuyuki Shimizu, Yasuo Yamamoto, Yuta Saito (* equal contribution)

ICML2024 Workshop: Aligning Reinforcement Learning Experimentalists and Theorists 2024

Efficient Offline Learning of Ranking Policies via Top-k Policy Decomposition

Ren Kishimoto*, Koichi Tanaka*, Haruka Kiyohara, Yusuke Narita, Nobuyuki Shimizu, Yasuo Yamamoto, Yuta Saito (* equal contribution)

ICML2024 Workshop: Aligning Reinforcement Learning Experimentalists and Theorists 2024