和地 瞭良 / Akifumi Wachi
Enlgish version is here.
強化学習(Reinforcement Learning, RL)の理論と応用全般に関して興味をもって研究しています。特に、以下の三つの研究テーマに最近は興味をもっています。
- Safe RL: 安全性に関する理論的保証のある強化学習アルゴリズムの設計
- 基盤モデルのための RL:言語モデルのアライメントなど、強化学習と自然言語処理(NLP)の融合
- RLによる敵対的検証: 強化学習を用いてAIシステムの安全性を検証する方法の開発
論文一覧・特許などの研究業績につきましては、英語ページ を御覧ください。
招待講演や共同研究、技術顧問等の依頼はメールにてご連絡ください。
経歴
- 2025 May - present: Senior Chief Research Scientist, LINEヤフー株式会社
- 2025 Jan - present: 技術顧問, 株式会社 Spakona
- 2023 Oct - 2025 Apr: Chief Research Scientist, LINEヤフー株式会社
- 2022 Sep - 2023 Sep: Senior Research Scientist, LINE株式会社
- 2018 Apr - 2022 Aug: Research Scientist, IBM東京基礎研究所
- 2021: 博士(情報工学)筑波大学(指導教員:佐久間淳 教授)
- 2018: 修士(航空宇宙工学)東京大学(指導教員:中須賀真一 教授)
- 2016: 学士(航空宇宙工学)東京大学(指導教員:中須賀真一 教授)
主要業績
- How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis Neural Information Processing Systems (NeurIPS), 2026. [PDF forthcoming]
- Reward-Estimated Hypergradient for Bilevel Reinforcement Learning with Black-Box Follower Neural Information Processing Systems (NeurIPS), 2026. [PDF forthcoming]
- Inference-Aware Meta-Alignment of LLMs via Non-Linear GRPO International Conference on Machine Learning (ICML), 2026. [ICML] [arXiv]
- Cost-Minimized Label-Flipping Poisoning Attack to LLM Alignment AAAI Conference on Artificial Intelligence (AAAI), 2026. [AAAI] [arXiv]
- A Provable Approach for End-to-End Safe Reinforcement Learning Neural Information Processing Systems (NeurIPS), 2025. [NeurIPS] [arXiv]
- Offline Guarded Safe Reinforcement Learning for Medical Treatment Optimization Strategies Neural Information Processing Systems (NeurIPS), 2025. (Spotlight) [NeurIPS] [arXiv]
- Stepwise Alignment for Constrained Language Model Policy Optimizations Neural Information Processing Systems (NeurIPS), 2024. [arXiv] [Poster] [GitHub] [Hugging Face (SACPO)] [Hugging Face (P-SACPO)]
- Flipping-based Policy for Chance-Constrained Markov Decision Processes Neural Information Processing Systems (NeurIPS), 2024. [arXiv]
- A Survey of Constraint Formulations in Safe Reinforcement Learning International Joint Conference on Artificial Intelligence (IJCAI), 2024. [arXiv] [Poster] [Slide]
- Long-term Safe Reinforcement Learning with Binary Feedback AAAI Conference on Artificial Intelligence (AAAI), 2024. [PDF] [Poster] [Slide]
- Safe Exploration in Reinforcement Learning: A Generalized Formulation and Algorithms Neural Information Processing Systems (NeurIPS), 2023. [PDF] [arXiv] [Poster] [Video]
- Safe Policy Optimization with Local Generalized Linear Function Approximations Neural Information Processing Systems (NeurIPS), 2021. [PDF] [OpenReview] [arXiv] [Poster]
- Neuro-Symbolic Reinforcement Learning with First-Order Logic Empirical Methods in Natural Language Processing (EMNLP), Short paper, 2021. [PDF]
- Language-based General Action Template for Reinforcement Learning Agents Association for Computational Linguistics (ACL), Findings, 2021. [PDF]
- Q-learning with Language Model for Edit-based Unsupervised Summarization Empirical Methods in Natural Language Processing (EMNLP), 2020. [PDF] [arXiv]
- Safe Reinforcement Learning in Constrained Markov Decision Processes International Conference on Machine Learning (ICML), 2020. [PDF] [arXiv] [Slide] [Video]
- Failure-Scenario Maker for Rule-Based Agent using Multi-agent Adversarial Reinforcement Learning and its Application to Autonomous Driving International Joint Conference on Artificial Intelligence (IJCAI), 2019. [PDF] [arXiv] [Slide] [Poster] [Simulation]
- Safe Exploration and Optimization of Constrained MDPs using Gaussian Processes AAAI Conference on Artificial Intelligence (AAAI), 2018. [PDF] [Slide]
コンペティション
- 第4回 空戦AIチャレンジ オープン部門 優勝 [解法(Qiita記事)]
その他
受賞
- Top Reviewer, NeurIPS, 2024 [link]
- 工学系研究科長賞(副代表), 東京大学, 2018
- 最優秀学生論文賞, Joint Conference: 31st ISTS, 26th ISSFD, and 8th NSAT, 2017
- 最優秀学生論文賞, IFAC Symposium on Automatic Control in Aerospace (ACA), 2016 [link]
講演
- 第28回情報論的学習理論ワークショップ(IBIS2025)チュートリアル「深層基盤モデルのための強化学習:驚きから理論に基づく納得へ」
[webpage] [slide] - 人工知能学会主催 第96回人工知能セミナー (2025.2.7) 「AIトレンド・トップカンファレンス報告会(NeurIPS2024):世界最先端のAI研究開発動向が1日でわかる!」
[webpage] [slide] - NLPコロキウム "Stepwise Alignment for Constrained Language Model Policy Optimization"
[webpage] [YouTube] [slide] - 大阪大学 数理・データ科学教育研究センター AI・データ利活用研究会 「安全性を考慮した強化学習:基礎から応用まで」
[webpage] - 鉄鋼協会 計測・制御・システム工学部会シンポジウム 「解釈性・信頼性の高いAI開発に向けたシステム技術」
[webpage] - 人工知能学会主催 第90回人工知能セミナー (2024.3.26) 「AIトレンド・トップカンファレンス報告会(NeurIPS2023):世界最先端のAI研究開発動向が1日でわかる!」
[webpage] [YouTube(学会概要と参加報告)] [YouTube(受賞論文「DPO」徹底解説)] [slide] - Safe Reinforcement Learning, Cohere Guest Speaker Session, February, 2024
[Cohere website] [slide]