- 项目正式重构完成,包含基础机器学习、深度学习、强化学习三大模块
- 所有历史提交记录已清理,从当前版本开始全新记录
- Classification: 基于FashionMNIST数据集的图像分类算法实现
- Regression: 线性回归与深度回归模型实现
- DQN: 经典深度Q网络算法实现,支持CartPole-v1、MountainCar-v0环境
- DDQN: 双重DQN算法实现,解决DQN过估计问题
- 统一文档目录
Documents/,按算法分类存放所有Markdown格式文档 - 包含算法原理说明、实验结果分析和深度学习基础文档
- 提供
index.md作为所有文档的统一入口索引 - 配置Git提交钩子,自动格式化提交信息为
YYMMDDHHMM: 标题格式
- 每个算法目录独立存放,含专属
requirements.txt依赖清单 - 数据集
data/和实验结果results/目录已加入.gitignore,避免大文件提交 - 代码与文档完全分离,代码目录仅保留运行相关文件
- 所有文档统一放在
Documents/目录下,便于查找和维护
- 新增OPE离线策略评估算法
- 实现了重要性采样、加权重要性采样、双鲁棒估计、FQE四种主流OPE算法
- 新增两个完整的离线实验环境:
- Pendulum-v1 倒立摆环境,内置10万条transition数据集
- Swimmer-v5 游泳机器人环境,内置训练/验证离线数据集
- 每个环境都包含完整的数据生成、模型训练、评估全流程代码
- 无需与环境交互即可评估新策略性能,降低探索成本和风险
- 新增
Documents/Reinforcement Learning/OPE.md文档,详细介绍OPE原理、实现和实验结果 - README已更新强化学习算法列表,补充OPE算法说明