ops/课题四成果展示-开源项目.md

5.3 KiB
Raw Permalink Blame History

  • 课题四成果展示

适配鹏城·脑海大模模型的对齐算法

  • 开源简介本项目在脑海模型上实现了基于拒绝采样的对齐算法。对齐Alignment 是大语言模型训练全流程中至关重要的一步,其目的是让大模型与人类意图、价值观对齐,生成 有用的Useful、无害的Harmless和诚实的Honest 内容。在脑海大模型实践中,我们优先考虑的目标是让模型与社会主义核心价值观对齐,使其生成符合网信办合规要求的内容。
  • 项目链接:开源链接
  • 目录说明:目录"step1_supervised_finetuning"中为监督学习微调,目录"step2_reward_model_finetuning"为奖励模型训练,目录"step3_reject_sampling"为拒绝采样对齐。

离线强化学习框架ORPO

  • 开源简介本项目实现了一个基于模型的离线强化学习算法框架ORPO (Optimistic Model Rollouts for Pessimistic Offline Policy Optimization, AAAI 2024),在被广泛使用的悲观离线策略优化中引入了基于模型的乐观采样方法。
  • 项目链接:开源链接
  • 目录说明:目录"toy_exp"中为简单二维场景示例,目录"offlinerlkit"中为三种Mujoco场景下的算法实现目录"run_example"为执行算法的脚本。

固定翼飞机强化学习训练环境

  • 开源简介:本项目提供了一个开源的固定翼飞机速度矢量控制强化学习环境,可用于研究使用强化学习进行固定翼飞机速度矢量控制的方法,也可以辅助进行通用强化学习算法的研究。
  • 项目链接:开源链接
  • 目录说明:目录"flycraft"中为本项目相关的开源内容。

固定翼飞机强化学习训练样例

  • 开源简介本项目提供了若干基于开源强化学习训练框架StableBaselines3与固定翼飞机强化学习训练环境FlyCraft进行强化学习训练的脚本样例。
  • 项目链接:开源链接
  • 目录说明:目录"train_scripts"中为训练脚本样例目录“configs”中为算法配置文件目录“demonstrations”中为生成示范数据的脚本目录“utils_my”中为辅助工具脚本目录“test”为测试脚本。

基于非最优专家数据的强化学习策略优化方法

  • 开源简介:本项目提供了一种结合模仿学习与强化学习的训练框架,该框架能够基于非最优专家数据有效的进行强化学习策略的训练。
  • 项目链接:开源链接
  • 目录说明:目录"train_scripts"中为训练脚本样例目录“configs”中为算法配置文件目录“demonstrations”中为生成示范数据的脚本目录“utils_my”中为辅助工具脚本。

基于不确定性的强化学习内在奖励方法

  • 开源简介:本项目提供了一种结合不确定性评估与内在奖励的训练框架,该框架能够基于不确定性自监督地生成准确的内在奖励并引导智能体进行强化学习策略的训练,无需外在奖励的设计。
  • 项目链接:开源链接
  • 目录说明:目录"polices"中为内在奖励模型的网络结构文件,主目录下为代码的主运行文件及其他文件。

基于互补学习理论的强化学习内在奖励方法

  • 开源简介:本项目提供了一种脑神经科学启发的互补学习理论框架与强化学习内在奖励的结合训练框架,该框架能够基于互补学习理论利用多个模型进行内在奖励地评估,并结合外在奖励对智能体进行强化学习策略的训练。
  • 项目链接:开源链接
  • 目录说明:目录"agent"中为不同的内在奖励模型的网络结构文件及参数文件,目录"custom_dmc_tasks"中为强化学习环境文件,主目录下为代码的主运行文件。

AI Service Engine

  • 开源简介AI Service EngineASE是一个专为AI能力开发者设计的全托管式AI算法引擎平台旨在通过云原生架构加速AI算法的云服务化简化部署、升级、扩缩和监控流程。ASE提供网络、分发策略、数据处理等辅助系统帮助开发者快速部署AI算法引擎。
  • 项目链接:开源链接1开源链接2
  • 目录说明:目录"main"主目录下为代码的主运行文件。