forked from ci4s/ops
5.3 KiB
5.3 KiB
-
课题四成果展示
适配鹏城·脑海大模模型的对齐算法
- 开源简介:本项目在脑海模型上实现了基于拒绝采样的对齐算法。对齐(Alignment) 是大语言模型训练全流程中至关重要的一步,其目的是让大模型与人类意图、价值观对齐,生成 有用的(Useful)、无害的(Harmless)和诚实的(Honest) 内容。在脑海大模型实践中,我们优先考虑的目标是让模型与社会主义核心价值观对齐,使其生成符合网信办合规要求的内容。
- 项目链接:开源链接
- 目录说明:目录"step1_supervised_finetuning"中为监督学习微调,目录"step2_reward_model_finetuning"为奖励模型训练,目录"step3_reject_sampling"为拒绝采样对齐。
离线强化学习框架ORPO
- 开源简介:本项目实现了一个基于模型的离线强化学习算法框架ORPO (Optimistic Model Rollouts for Pessimistic Offline Policy Optimization, AAAI 2024),在被广泛使用的悲观离线策略优化中引入了基于模型的乐观采样方法。
- 项目链接:开源链接
- 目录说明:目录"toy_exp"中为简单二维场景示例,目录"offlinerlkit"中为三种Mujoco场景下的算法实现,目录"run_example"为执行算法的脚本。
固定翼飞机强化学习训练环境
- 开源简介:本项目提供了一个开源的固定翼飞机速度矢量控制强化学习环境,可用于研究使用强化学习进行固定翼飞机速度矢量控制的方法,也可以辅助进行通用强化学习算法的研究。
- 项目链接:开源链接
- 目录说明:目录"flycraft"中为本项目相关的开源内容。
固定翼飞机强化学习训练样例
- 开源简介:本项目提供了若干基于开源强化学习训练框架StableBaselines3与固定翼飞机强化学习训练环境FlyCraft进行强化学习训练的脚本样例。
- 项目链接:开源链接
- 目录说明:目录"train_scripts"中为训练脚本样例,目录“configs”中为算法配置文件,目录“demonstrations”中为生成示范数据的脚本,目录“utils_my”中为辅助工具脚本,目录“test”为测试脚本。
基于非最优专家数据的强化学习策略优化方法
- 开源简介:本项目提供了一种结合模仿学习与强化学习的训练框架,该框架能够基于非最优专家数据有效的进行强化学习策略的训练。
- 项目链接:开源链接
- 目录说明:目录"train_scripts"中为训练脚本样例,目录“configs”中为算法配置文件,目录“demonstrations”中为生成示范数据的脚本,目录“utils_my”中为辅助工具脚本。
基于不确定性的强化学习内在奖励方法
- 开源简介:本项目提供了一种结合不确定性评估与内在奖励的训练框架,该框架能够基于不确定性自监督地生成准确的内在奖励并引导智能体进行强化学习策略的训练,无需外在奖励的设计。
- 项目链接:开源链接
- 目录说明:目录"polices"中为内在奖励模型的网络结构文件,主目录下为代码的主运行文件及其他文件。
基于互补学习理论的强化学习内在奖励方法
- 开源简介:本项目提供了一种脑神经科学启发的互补学习理论框架与强化学习内在奖励的结合训练框架,该框架能够基于互补学习理论利用多个模型进行内在奖励地评估,并结合外在奖励对智能体进行强化学习策略的训练。
- 项目链接:开源链接
- 目录说明:目录"agent"中为不同的内在奖励模型的网络结构文件及参数文件,目录"custom_dmc_tasks"中为强化学习环境文件,主目录下为代码的主运行文件。