Skip to content

Latest commit

 

History

History
44 lines (34 loc) · 1.95 KB

File metadata and controls

44 lines (34 loc) · 1.95 KB

Changelog

26.03.17

✨ 项目初始化

  • 项目正式重构完成,包含基础机器学习、深度学习、强化学习三大模块
  • 所有历史提交记录已清理,从当前版本开始全新记录

📁 项目结构

Basic Learning 基础机器学习

  • Classification: 基于FashionMNIST数据集的图像分类算法实现
  • Regression: 线性回归与深度回归模型实现

Reinforcement Learning 强化学习

  • DQN: 经典深度Q网络算法实现,支持CartPole-v1、MountainCar-v0环境
  • DDQN: 双重DQN算法实现,解决DQN过估计问题

📚 文档配置

  • 统一文档目录Documents/,按算法分类存放所有Markdown格式文档
  • 包含算法原理说明、实验结果分析和深度学习基础文档
  • 提供index.md作为所有文档的统一入口索引
  • 配置Git提交钩子,自动格式化提交信息为YYMMDDHHMM: 标题格式

🔧 开发规范

  • 每个算法目录独立存放,含专属requirements.txt依赖清单
  • 数据集data/和实验结果results/目录已加入.gitignore,避免大文件提交
  • 代码与文档完全分离,代码目录仅保留运行相关文件
  • 所有文档统一放在Documents/目录下,便于查找和维护

26.03.18

✨ 新增功能

  • 新增OPE离线策略评估算法
    • 实现了重要性采样、加权重要性采样、双鲁棒估计、FQE四种主流OPE算法
    • 新增两个完整的离线实验环境:
      • Pendulum-v1 倒立摆环境,内置10万条transition数据集
      • Swimmer-v5 游泳机器人环境,内置训练/验证离线数据集
    • 每个环境都包含完整的数据生成、模型训练、评估全流程代码
    • 无需与环境交互即可评估新策略性能,降低探索成本和风险

📚 文档更新

  • 新增Documents/Reinforcement Learning/OPE.md文档,详细介绍OPE原理、实现和实验结果
  • README已更新强化学习算法列表,补充OPE算法说明