Compare commits

..

No commits in common. "master" and "master" have entirely different histories.

13 changed files with 144 additions and 236 deletions

Binary file not shown.

Before

Width:  |  Height:  |  Size: 135 KiB

Binary file not shown.

Before

Width:  |  Height:  |  Size: 226 KiB

Binary file not shown.

Before

Width:  |  Height:  |  Size: 54 KiB

Binary file not shown.

Before

Width:  |  Height:  |  Size: 566 KiB

Binary file not shown.

Before

Width:  |  Height:  |  Size: 274 KiB

Binary file not shown.

Before

Width:  |  Height:  |  Size: 107 KiB

Binary file not shown.

Before

Width:  |  Height:  |  Size: 159 KiB

Binary file not shown.

Before

Width:  |  Height:  |  Size: 363 KiB

View File

@ -1,97 +1,2 @@
# 复杂智能软件系统集成部署与运行演化
# ops
课题四聚焦于复杂智能软件系统在全生命周期内的**高效集成部署**与**动态运行演化**。从智能软件资源版本管理与集成框架、系统运行演化参考架构、微服务适配与编织三个方面展开研究,并取得了多项突破性进展。
研究成果已成功应用于鹏城脑海、讯飞星火等千亿参数大模型的训练与服务,显著提升了智能软件的集成效率、部署性能和资源利用率。
# 一、智能软件开发与运行一体化框架
此部分内容聚焦复杂智能软件系统构造与演化流程中的“推理服务”和“应用开发”步骤。
- **容器构建故障根因类型分类**
<img src="./README.assets/容器构建故障根因类型分类.png" style="zoom:50%;">
本项目构建了一个包含7 个主要类别和23 个子类别的DBFs 根本原因分类框架。整合了开发社区、问答社区、技术论坛等多平台,的容器构建故障信息,提出了一套系统、完善的故障症状分类框架,实现了对容器构建故障症状的精准分类和快速识别,能够为容器故障的诊断与修复提供有价值的参考和指导。
- **智能软件生产平台架构**
<img src="./README.assets/智能软件生产平台架构.png" style="zoom:50%;">
本项目构建了智能软件生产流水线引擎及对应的生产平台,平台架构如图所示,以流水线引擎为基础,支持面向复杂智能软件生产的数据持续构造、模型迭代训练以及应用快速开发。
# 二、智能软件系统运行参考架构
此部分内容聚焦复杂智能软件系统构造与演化流程中的“推理服务”步骤。
- **基于事件的故障实时监测与诊断一体化架构**
<img src="./README.assets/基于事件的故障实时监测与诊断一体化架构.png" style="zoom:50%;">
基于事件的故障实时监测与诊断一体化架构如图69 所示,智能软件排障系统主要包括推理引擎服务集群、事件收集服务、诊断和应急服务。
- **统一监控标准模型**
<img src="./README.assets/统一监控标准模型.png" style="zoom:50%;">
建立统一监控标准模型体系如图所示以实现对企业IT 系统和业务应用的全方位、立体化、可视化监控,提高运维效率和质量,降低运维成本并增强系统的稳定性和可用性。
# 三、微服务智能适配与动态编织
此部分内容聚焦复杂智能软件系统构造与演化流程中的“应用开发”步骤。
- **语音识别语言模型交互协议框架**
<img src="./README.assets/语音识别语言模型交互协议框架.png" style="zoom:80%;">
本项目设计的智能模型服务交互标准化协议支持在不同推理引擎间编排串联服务可实现零代码编排设计在语音翻译、图文翻译等场景下具有良好的适用性。图74 展示了在中文语音识别和中英翻译两种AI 能力服务组合的示意流程。
- **业务流执行引擎核心流程**
<img src="./README.assets/业务流执行引擎核心流程.png" style="zoom:50%;">
智能微服务在应用落地过程中需要考虑多种类型服务的动态组合与编排针对这一需求研究微服务动态编织技术以微服务网关接入的AI 能力服务为基础构建低代码、可视化方式定制的服务业务流编排引擎实现AI 能力的快速集成。
# 四、智能模型持续学习支持机制
此部分内容聚焦复杂智能软件系统构造与演化流程中的“维护反馈”步骤。
- **人机协作的大模型持续迭代机制**
<img src="./README.assets/人机协作的大模型持续迭代机制.png" style="zoom:50%;">
大模型在交互过程中通过收集反馈数据用于迭代调优,实现人机协作的复杂智能软件系统开发。基于“持续学习”的特点,大模型在与人类协作和环境交互过程中应该具有持续学习的能力,形成人机协作共同持续学习进步的生态。
- **基于解析学习范式的图像分类持续学习**
<img src="./README.assets/基于解析学习范式的图像分类持续学习.png" style="zoom:100%;">
为解决图像分类中持续学习的关键挑战——灾难性遗忘,即模型在学习新类别时往往忘记已学的旧知识。本项目的解决方案通过引入解析学习机制,在不回放旧数据的情况下有效缓解遗忘,使模型能够持续积累新类别并准确识别所有已学类别,提升了模型的长期学习能力和实用性。
# 五、成果产出
依托相关成果在论文、专利、软著和开源项目方面在国际会议和期刊发表和录用论文26篇申请发明专利14项申请软件著作权12项开源项目8项。
成果链接如下:
- [课题四成果展示-论文](https://www.gitlink.org.cn/ci4s/ops/tree/master/课题四成果展示-论文.md)
- [课题四成果展示-专利](https://www.gitlink.org.cn/ci4s/ops/tree/master/课题四成果展示-专利.md)
- [课题四成果展示-软著](https://www.gitlink.org.cn/ci4s/ops/tree/master/课题四成果展示-软著.md)
- [课题四成果展示-开源项目](https://www.gitlink.org.cn/ci4s/ops/tree/master/课题四成果展示-开源项目.md)

View File

@ -1,22 +1,29 @@
# 课题四成果展示
#### 专利成果
| 编号 | 专利标题 | 发明人 | 状态 | 编号 | 摘要 | [链接](#) |
| ---- | -------------------------------------------------- | ---------------------------------------------------------- | ------ | -------------- | ------------------------------------------------------------ | --------- |
| 1 | 模型训练方法、装置及计算机存储介质 | 江苏云从曦和人工智能有限公司:王曦,蹇易 | 已授权 | 202210789561.9 | 针对模型训练效率低问题基于蒸馏学习方法研究了如何根据用户的业务反馈和标注数据实现模型迭代提出了利用教师模型针对每一个训练样本执行特征提取获得每一个训练样本的教师特征根据每一个训练样本的教师特征和真实标签确定每一个训练样本的难样本利用学生模型针对每一个训练样本执行特征提取获取每一个训练样本的学生特征根据每一个训练样本的学生特征、每一个训练样本的难样本训练所述学生模型。提升了模型训练效果并提升模型预测精度。为1.2:#软件代码与智能模型混合的系统参考架构的新型人机协同机制提供技术支撑使得AI模型在金融场景通过业务数据平台、推理&训练平台和数据标注闭环系统三大核心关键技术,构建新型人机协同技术下的智慧金融平台。 | |
| 2 | 一种容器镜像标签自动化匹配方法、装置及计算机设备 | 国防科技大学:冯大为、王涛、许可乐、彭皓秋 | 已受理 | 202211676373.1 | 针对镜像仓库中存在大量的镜像但无镜像特征描述、镜像中软件及环境依赖未知从而无法进行镜像检索与镜像版本管理的问题使用基于规则匹配方法提出了镜像标签、镜像环境变量、镜像发行版、镜像开放端口以及镜像内软件及版本完成了镜像的版本管理为课题开展1.1:#软件资源版本管理与开发运行一体化框架的镜像版本管理提供了工具支撑。 | |
| 3 | 组件分析方法及相关装置 | 科大讯飞股份有限公司:章清,龙明康,刘坤 | 已受理 | 202210255463.7 | 针对智能模型的线上运行故障监测等问题基于趋势预测、同构数据拟合、实时堆栈抓取等方法研究了生产环境节点实时排障的方法提出了对故障现场进行信息采集、故障分析、辅助诊断等一体化方法实现了从故障现场数据难以获取到分钟获取以及问题辅助诊断的建议为课题开展1.2:#软件代码与智能模型混合的系统参考架构的运行监测以及系统在稳定性方面的持续演化,提升了系统的维护与运行效率。 | |
| 4 | 智能引擎接入和调用方法及相关平台、装置、设备、介质 | 科大讯飞股份有限公司:潘建龙,盛可俊,李珍松,刘坤,龙明康 | 已授权 | 202210414017.6 | 针对代码与智能模型充分解耦的问题基于低代码、云原生等方法研究了智能微服务的构造提出了一种端到端的系统构造框架完成了模型与代码的充分解耦实现了智能微服务构造与部署的效率为课题开展1.2:#软件代码与智能模型混合的系统参考架构的业务与模型松耦合的系统构造提供框架与工具支撑,为智能单元高效构造奠定了基础。 | |
| 5 | 大模型智能体交互问答任务决策方法、装置、设备及介质 | 冯大为,许可乐,杨廷楷,翟远钊,杨森,杨程,张迅晖,丁博,王怀民 | 已受理 | 202411251132.1 | 基于部分可观察的马尔科夫决策过程构建智能体策略模型获取用户输入指令采用智能体策略模型生成信息搜索轨迹采用蒙特卡洛树搜索算法构建信息搜索轨迹的决策树得到Q值标注的偏好数据集设置一个大语言模型根据Q值标注的偏好数据集采用步骤级优化目标函数对大语言模型进行训练得到训练好的大语言模型根据训练好的大语言模型构建Q值模型然后根据Q值模型输出Q值估计根据Q值估计和信息搜索轨迹选择动作生成问答流程。本发明为课题开展1.1:#软件资源版本管理与开发运行一体化框架显著增强了大模型智能体在自主推理和决策过程中的表现及泛化能力。 | |
| 6 | 融合控制律模型的固定翼飞机控制策略持续优化方法 | 国防科技大学:许可乐、冯大为、巩旭东、丁博、王怀民 | 已受理 | 202411656864.9 | 本发明提出一种适用于固定翼飞机速度矢量控制的控制器设计方法与迭代训练策略与提升专家数据质量的方法。1结合神经网络与控制律模型的控制器设计使神经网络的输出经过一个制导律模型的平滑后成为最终输出平滑的输出降低了强化学习训练的难度2迭代训练策略与提升专家数据质量的方法使用迭代训练策略与提升专家数据质量的训练方法使得1.2#软件代码与智能模型混合的系统参考架构可以基于非最优专家数据高效的学习到表现优秀的策略。 | |
| 7 | 一种同策略多目标强化学习框架的设计方法、装置及设备 | 国防科技大学:冯大为、巩旭东、翟远钊、许可乐、丁博、王怀民 | 已受理 | 202411657260.6 | 本发明提出本专利提出一种同策略多目标强化学习训练方法。该方法包括基于专家数据使用模仿学习方法对策略进行预训练使用自课程学习方法对策略进行在线微调。本专利所提方法可以同时适用于马尔科夫奖励问题与非马尔科夫奖励问题件且属于同策略强化学习方法为1.2#软件代码与智能模型混合的系统参考架构多目标强化学习领域中的提供了同策略强化学习方法。 | |
| 8 | 基于提示词鲁棒性的指令数据优选方法、装置及设备 | 国防科技大学:冯大为、王强、翟远钊、丁博、王怀民 | 已受理 | 202411657260.6 | 本发明公开了一种基于提示词鲁棒性的指令数据优选方法、装置及设备。所述方法包括获取指令数据样本构建鲁棒性评估函数对指令数据样本进行指令调优以获取答案分数根据答案分数评估指令数据样本的跟踪难度得到指令跟随难度评分分别按照字符级、单词级以及句子级对数据样本集进行攻击生成对抗性提示词根据对抗性提示词、指令跟随难度评分以及答案分数生成对抗指令跟随难度分数将对抗提示词与提示词分别输入至大语言模型中进行训练得到对抗提示词嵌入表示与提示词嵌入表示根据对抗提示词嵌入表示与提示词嵌入表示对指令数据样本的质量进行评估得到优选的指令数据。本发明可提升1.2#软件代码与智能模型混合的系统参考架构基于提示词鲁棒性的指令数据优选效率和精度。 | |
| 9 | 基于大语言模型的API自动反馈系统、方法及设备 | 国防科技大学 #冯大为、许可乐、翟远钊、丁博、王怀民 | 已受理 | 202411665418.4 | 本发明涉及人工智能领域面向基于大语言模型的API生成任务中的决策方法、装置、设备及介质。大语言模型与外部工具集成时正确API请求生成效率低难以协作完成任务。针对此问题本发明提出一种基于自动反馈的增强大语言模型感知的方法。本发明将API请求生成的主要错误类型细化并实现了自动检测模块将其检测的错误加入反馈增强静态反馈的事实性以API请求执行后返回的错误结果作为查询信息通过分层检索API文档中的相关错误说明增强动态反馈的信息量最终实现静态与动态反馈的迭代循环。本发明能够有效提升1.2#软件代码与智能模型混合的系统参考架构大模型智能体在数据库查询,工具协作等场景中的表现,具有广阔的市场应用前景,能够显著提高人工智能系统的交互质量和用户满意度。 | |
| 10 | 算力资源调度方法、装置、电子设备和存储介质 | 科大讯飞股份有限公司#吴义平;张升阳;刘世杰;陈建 | 已受理 | 202311870621.0 | 针对智能微服务提供规模化在线推理服务时针对模型部署效率不高、传统的基础设施难以灵活应对流量的峰谷变化等问题提出了一种云内云际资源需求的预测与调度方法实现灵活、高效的多云协同部署机制与工具。为课题开展1.2:#软件代码与智能模型混合的系统参考架构中的智能软件单元部署的研究奠定了基础。 | |
| 11 | 数据传输处理系统 | 江苏云从曦和人工智能有限公司#戴海峰 | 已授权 | 202210304330.4 | 本发明涉及数据处理技术领域,具体提供一种数据传输处理系统,旨在解决如何有效传输数据的问题。为此目的,本发明的系统中每个等级的数据处理平台分别与各自对应的上一等级与下一等级的数据处理平台通信连接;最高等级的数据处理平台上设置有共享配置中心,该中心用于对所有等级的数据处理平台的共享数据处理策略进行同步管理,保证所有数据处理平台对同一数据的处理操作保持一致,不产生冲突;非最高等级的数据处理平台包括第一数据同步模块和第二数据同步模块,通过这两个模块可以实现下级从上级主动拉取数据以及下级向上级主动推送数据,保证任意一个数据处理平台存储的数据发生更新后其他数据处理平台都可以获取到更新的数据,实现数据同步。 | |
| 12 | 任务实例运行方法、装置以及计算机可读存储介质 | 江苏云从曦和人工智能有限公司#姜迅、邱凌峰、郑惠沄、何德峰 | 已授权 | 202210794226.8 | 本发明涉及计算机处理技术领域,具体提供一种任务实例运行方法、装置以及计算机可读存储介质,旨在正常调度不同周期且具有依赖关系的任务,该方法包括:获取时空有向无环图,时空有向无环图中包括多个节点和多个有向边,多个顶点指示了多个任务实例的运行状态和运行时间,每个有向边连接两个顶点,其方向指示了两个顶点对应的任务实例间的依赖关系;根据时空有向无环图,查找运行时间小于或等于当前时间、处于待运行状态、不依赖其他任务实例或所依赖任务实例处于运行成功状态的第一组任务实例;运行第一组任务实例,并根据运行结果在对应顶点处更新第一组任务实例的运行状态。本发明通过将任务拆解为任务实例,实现不同周期任务正常调度。 | |
| 13 | 目标检测方法、系统、装置及介质 | 江苏云从曦和人工智能有限公司#陈佳鹏 | 已授权 | 202210804133.9 | 本发明涉及目标检测技术领域具体提供一种目标检测方法、系统、装置及介质旨在解决在进行目标检测过程中如何准确地检测并获得图像中的人体、人脸以及人体和人脸的关联关系的问题。为此目的本发明对待检测图像分别进行人脸检测、人体检测和人脸人体关联检测并根据上述检测结果来获取待检测图像的最终目标检测结果综合考虑了人脸检测、人体检测和人脸人体关联检测对最终目标检测结果的影响能够更为准确有效地检测出待检测图像中的人体、人脸以及人体和人脸之间的关联关系针对人脸被遮挡或者只露出人脸的情况也能实现很好的检测效果。为课题开展1.3 #基于微服务的软件资源智能适配与动态互联中的智能软件单元部署的研究奠定了基础。 | |
| 14 | 虚拟对象在仿真地图上的寻路方法及计算机可读存储介质 | 江苏云从曦和人工智能有限公司#张鹏飞 | 已授权 | 202310064704.4 | 本发明涉及虚拟对象在仿真地图上的寻路方法及计算机可读存储介质,所述方法包括:将仿真地图划分为多个区块地图;根据所述仿真地图生成从起点到终点的初始路径;控制虚拟对象 沿所述初始路径进入所途经的区块地图;根据所进入的区块地图进行路径规划以生成对应区块地图内的更新路径,以及进行移动仿真以控制所述虚拟对象沿所述更新路径行进。在实施本发明的技术方案中,通过将仿真地图拆分成区块地图实现对路径的逐步细化,从而避免了在进行仿真计算时数据的庞大,有效地减少了大地图仿真模拟时对于算力的需求。 | |
- # 课题四成果展示
#### 专利成果
| 编号 | 专利标题 | 发明人 | 状态 | 编号 | 摘要 | [链接](#) |
| --------- | -------- | -------- | ---------------- | ---------------------------------------- | --------- | --------- |
| 1| 模型训练方法、装置及计算机存储介质 | 江苏云从曦和人工智能有限公司:王曦,蹇易 | 已授权 | 202210789561.9 | 针对模型训练效率低问题基于蒸馏学习方法研究了如何根据用户的业务反馈和标注数据实现模型迭代提出了利用教师模型针对每一个训练样本执行特征提取获得每一个训练样本的教师特征根据每一个训练样本的教师特征和真实标签确定每一个训练样本的难样本利用学生模型针对每一个训练样本执行特征提取获取每一个训练样本的学生特征根据每一个训练样本的学生特征、每一个训练样本的难样本训练所述学生模型。提升了模型训练效果并提升模型预测精度。为1.2:#软件代码与智能模型混合的系统参考架构的新型人机协同机制提供技术支撑使得AI模型在金融场景通过业务数据平台、推理&训练平台和数据标注闭环系统三大核心关键技术,构建新型人机协同技术下的智慧金融平台。|
|2|一种容器镜像标签自动化匹配方法、装置及计算机设备|国防科技大学:冯大为、王涛、许可乐、彭皓秋|已受理 | 202211676373.1|针对镜像仓库中存在大量的镜像但无镜像特征描述、镜像中软件及环境依赖未知从而无法进行镜像检索与镜像版本管理的问题使用基于规则匹配方法提出了镜像标签、镜像环境变量、镜像发行版、镜像开放端口以及镜像内软件及版本完成了镜像的版本管理为课题开展1.1:#软件资源版本管理与开发运行一体化框架的镜像版本管理提供了工具支撑。
| 3| 组件分析方法及相关装置 | 科大讯飞股份有限公司:章清,龙明康,刘坤 | 已受理 | 202210255463.7 |针对智能模型的线上运行故障监测等问题基于趋势预测、同构数据拟合、实时堆栈抓取等方法研究了生产环境节点实时排障的方法提出了对故障现场进行信息采集、故障分析、辅助诊断等一体化方法实现了从故障现场数据难以获取到分钟获取以及问题辅助诊断的建议为课题开展1.2:#软件代码与智能模型混合的系统参考架构的运行监测以及系统在稳定性方面的持续演化,提升了系统的维护与运行效率。||
|4 |智能引擎接入和调用方法及相关平台、装置、设备、介质 | 科大讯飞股份有限公司:潘建龙,盛可俊,李珍松,刘坤,龙明康| 已授权| 202210414017.6 |针对代码与智能模型充分解耦的问题基于低代码、云原生等方法研究了智能微服务的构造提出了一种端到端的系统构造框架完成了模型与代码的充分解耦实现了智能微服务构造与部署的效率为课题开展1.2:#软件代码与智能模型混合的系统参考架构的业务与模型松耦合的系统构造提供框架与工具支撑,为智能单元高效构造奠定了基础。|
|5 | 大模型智能体交互问答任务决策方法、装置、设备及介质| 冯大为,许可乐,杨廷楷,翟远钊,杨森,杨程,张迅晖,丁博,王怀民 | 已受理 | 202411251132.1 | 基于部分可观察的马尔科夫决策过程构建智能体策略模型获取用户输入指令采用智能体策略模型生成信息搜索轨迹采用蒙特卡洛树搜索算法构建信息搜索轨迹的决策树得到Q值标注的偏好数据集设置一个大语言模型根据Q值标注的偏好数据集采用步骤级优化目标函数对大语言模型进行训练得到训练好的大语言模型根据训练好的大语言模型构建Q值模型然后根据Q值模型输出Q值估计根据Q值估计和信息搜索轨迹选择动作生成问答流程。本发明为课题开展1.1:#软件资源版本管理与开发运行一体化框架显著增强了大模型智能体在自主推理和决策过程中的表现及泛化能力。|
| 6| 融合控制律模型的固定翼飞机控制策略持续优化方法| 国防科技大学:许可乐、冯大为、巩旭东、丁博、王怀民| 已受理 | 202411656864.9 | 本发明提出一种适用于固定翼飞机速度矢量控制的控制器设计方法与迭代训练策略与提升专家数据质量的方法。1结合神经网络与控制律模型的控制器设计使神经网络的输出经过一个制导律模型的平滑后成为最终输出平滑的输出降低了强化学习训练的难度2迭代训练策略与提升专家数据质量的方法使用迭代训练策略与提升专家数据质量的训练方法使得1.2#软件代码与智能模型混合的系统参考架构可以基于非最优专家数据高效的学习到表现优秀的策略。|
| 7|一种同策略多目标强化学习框架的设计方法、装置及设备 |国防科技大学:冯大为、巩旭东、翟远钊、许可乐、丁博、王怀民 | 已受理 | 202411657260.6|本发明提出本专利提出一种同策略多目标强化学习训练方法。该方法包括基于专家数据使用模仿学习方法对策略进行预训练使用自课程学习方法对策略进行在线微调。本专利所提方法可以同时适用于马尔科夫奖励问题与非马尔科夫奖励问题件且属于同策略强化学习方法为1.2#软件代码与智能模型混合的系统参考架构多目标强化学习领域中的提供了同策略强化学习方法。|
|8 |基于提示词鲁棒性的指令数据优选方法、装置及设备 |国防科技大学:冯大为、王强、翟远钊、丁博、王怀民 | 已受理 |202411657260.6 |本发明公开了一种基于提示词鲁棒性的指令数据优选方法、装置及设备。所述方法包括获取指令数据样本构建鲁棒性评估函数对指令数据样本进行指令调优以获取答案分数根据答案分数评估指令数据样本的跟踪难度得到指令跟随难度评分分别按照字符级、单词级以及句子级对数据样本集进行攻击生成对抗性提示词根据对抗性提示词、指令跟随难度评分以及答案分数生成对抗指令跟随难度分数将对抗提示词与提示词分别输入至大语言模型中进行训练得到对抗提示词嵌入表示与提示词嵌入表示根据对抗提示词嵌入表示与提示词嵌入表示对指令数据样本的质量进行评估得到优选的指令数据。本发明可提升1.2#软件代码与智能模型混合的系统参考架构基于提示词鲁棒性的指令数据优选效率和精度。 |
| 9| 基于大语言模型的API自动反馈系统、方法及设备| 国防科技大学 #冯大为、许可乐、翟远钊、丁博、王怀民| 已受理 | 202411665418.4| 本发明涉及人工智能领域面向基于大语言模型的API生成任务中的决策方法、装置、设备及介质。大语言模型与外部工具集成时正确API请求生成效率低难以协作完成任务。针对此问题本发明提出一种基于自动反馈的增强大语言模型感知的方法。本发明将API请求生成的主要错误类型细化并实现了自动检测模块将其检测的错误加入反馈增强静态反馈的事实性以API请求执行后返回的错误结果作为查询信息通过分层检索API文档中的相关错误说明增强动态反馈的信息量最终实现静态与动态反馈的迭代循环。本发明能够有效提升1.2#软件代码与智能模型混合的系统参考架构大模型智能体在数据库查询,工具协作等场景中的表现,具有广阔的市场应用前景,能够显著提高人工智能系统的交互质量和用户满意度。|
|10 |算力资源调度方法、装置、电子设备和存储介质 |科大讯飞股份有限公司#吴义平;张升阳;刘世杰;陈建| 已受理 | 202311870621.0| 针对智能微服务提供规模化在线推理服务时针对模型部署效率不高、传统的基础设施难以灵活应对流量的峰谷变化等问题提出了一种云内云际资源需求的预测与调度方法实现灵活、高效的多云协同部署机制与工具。为课题开展1.2:#软件代码与智能模型混合的系统参考架构中的智能软件单元部署的研究奠定了基础。 |
|11 |数据传输处理系统 |江苏云从曦和人工智能有限公司#戴海峰 | 已授权 |202210304330.4 | 本发明涉及数据处理技术领域,具体提供一种数据传输处理系统,旨在解决如何有效传输数据的问题。为此目的,本发明的系统中每个等级的数据处理平台分别与各自对应的上一等级与下一等级的数据处理平台通信连接;最高等级的数据处理平台上设置有共享配置中心,该中心用于对所有等级的数据处理平台的共享数据处理策略进行同步管理,保证所有数据处理平台对同一数据的处理操作保持一致,不产生冲突;非最高等级的数据处理平台包括第一数据同步模块和第二数据同步模块,通过这两个模块可以实现下级从上级主动拉取数据以及下级向上级主动推送数据,保证任意一个数据处理平台存储的数据发生更新后其他数据处理平台都可以获取到更新的数据,实现数据同步。|
|12 |任务实例运行方法、装置以及计算机可读存储介质 |江苏云从曦和人工智能有限公司#姜迅、邱凌峰、郑惠沄、何德峰 | 已授权| 202210794226.8 | 本发明涉及计算机处理技术领域,具体提供一种任务实例运行方法、装置以及计算机可读存储介质,旨在正常调度不同周期且具有依赖关系的任务,该方法包括:获取时空有向无环图,时空有向无环图中包括多个节点和多个有向边,多个顶点指示了多个任务实例的运行状态和运行时间,每个有向边连接两个顶点,其方向指示了两个顶点对应的任务实例间的依赖关系;根据时空有向无环图,查找运行时间小于或等于当前时间、处于待运行状态、不依赖其他任务实例或所依赖任务实例处于运行成功状态的第一组任务实例;运行第一组任务实例,并根据运行结果在对应顶点处更新第一组任务实例的运行状态。本发明通过将任务拆解为任务实例,实现不同周期任务正常调度。|
|13 |目标检测方法、系统、装置及介质 |江苏云从曦和人工智能有限公司#陈佳鹏| 已授权 | 202210804133.9 | 本发明涉及目标检测技术领域具体提供一种目标检测方法、系统、装置及介质旨在解决在进行目标检测过程中如何准确地检测并获得图像中的人体、人脸以及人体和人脸的关联关系的问题。为此目的本发明对待检测图像分别进行人脸检测、人体检测和人脸人体关联检测并根据上述检测结果来获取待检测图像的最终目标检测结果综合考虑了人脸检测、人体检测和人脸人体关联检测对最终目标检测结果的影响能够更为准确有效地检测出待检测图像中的人体、人脸以及人体和人脸之间的关联关系针对人脸被遮挡或者只露出人脸的情况也能实现很好的检测效果。为课题开展1.3 #基于微服务的软件资源智能适配与动态互联中的智能软件单元部署的研究奠定了基础
|14|虚拟对象在仿真地图上的寻路方法及计算机可读存储介质 |江苏云从曦和人工智能有限公司#张鹏飞 | 已授权 |202310064704.4 | 本发明涉及虚拟对象在仿真地图上的寻路方法及计算机可读存储介质,所述方法包括:将仿真地图划分为多个区块地图;根据所述仿真地图生成从起点到终点的初始路径;控制虚拟对象 沿所述初始路径进入所途经的区块地图;根据所进入的区块地图进行路径规划以生成对应区块地图内的更新路径,以及进行移动仿真以控制所述虚拟对象沿所述更新路径行进。在实施本发明的技术方案中,通过将仿真地图拆分成区块地图实现对路径的逐步细化,从而避免了在进行仿真计算时数据的庞大,有效地减少了大地图仿真模拟时对于算力的需求。|
|15| 一种代码注释的方法、控制装置和存储介质| 江苏云从曦和人工智能有限公司#徐磊、张岭| 已授权| 202310347677.1 |本发明涉及计算机技术领域,具体提供一种代码注释的方法、控制装置和存储介质,旨在解决代码对应的非文本文档丢失无法调取查看和非文本文档更新后维护非文本文档与代码的对应关系较为困难的问题。为此目的,本发明的代码注释方法包括:监测在代码注释中是否存在第一非文本注释标记;若监测到代码注释中存在所述第一非文本注释标记,将所述第一非文本注释标记对应的非文本文件以预设形式添加到所述代码注释中,以形成第二非文本注释标记。 |
|16|设备通信方法、系统、电子设备、及存储介质 |江苏云从曦和人工智能有限公司#李毅峰 | 已授权 | 202310664986.1 | 本发明涉及物联网通信技术领域,具体提供一种设备通信方法、系统、电子设备、及存储介质,旨在解决物联网设备之间通信的可达性和消息完整性难以保障的问题。为此目的,本发明的设备通信方法包括:网络通信前,基于网络环境和设备信息进行预分析;基于预分析结果获取传输层协议及应用层编码协议;基于所述传输层协议和应用层编码协议进行网络通信;网络通信后,选择性地进行幂等性校验以及数据可靠性确认。从网络环境、设计编码、幂等性、数据可靠性等多方案综合改进,解决了物联网设备之间通信的可达性和消息完整性难以保障的问题,满足了弱网环境且弱设备性能下的物联网设备稳定通信。|
|17|混沌测试方法、电子设备及介质| 江苏云从曦和人工智能有限公司#贾广辽| 已授权 |202310876208.9 | 本发明涉及测试技术领域具体提供一种混沌测试方法、电子设备及介质旨在解决现有容器技术在使用中无法维持服务的高可用性、增加了用户时间成本进而影响用户体验的问题。为此目的本发明通过S1、基于混沌测试平台开启待测试服务的混沌测试S2、获取混沌测试中的测试问题S3、判断测试问题是否被修复并且当测试问题未被修复时判断是否修改测试指标S4、基于是否修改测试指标的判断结果控制待测试服务执行相应的测试操作直至测试问题被修复。这样的设置能够验证待测试服务在各类异常状态下的处理策略便于针对性地对待测试服务进行加固以及防范从而维持待测试服务的高可用性降低用户的时间成本提升用户的使用体验。为课题开展1.3 #基于微服务的软件资源智能适配与动态互联中的智能软件单元部署的研究奠定了基础。|
|18|一种应用分配方法、存储介质以及双机互备系统 | 江苏云从曦和人工智能有限公司#范启辉| 已授权 | 202311127790.5 | 本发明的一种应用分配方法方法应用于双机互备系统中的一台服务器系统包括两台服务器系统内设置有至少一个模式的应用应用的模式包括单机模式和热备模式方法包括获取自身服务器的主备身份当自身服务器为主服务器时主服务器基于两台服务器的应用配置情况以及各个应用所对应的模式将各个应用选择性地在两台服务器上进行分配。通过当获取到自身服务器为主服务器时主服务器根据两台服务器的应用配置情况和应用的模式将各个应用选择性地分配到两台服务器上实现了应用的模式与服务器的应用配置相匹配提高了系统在对两种模式下的应用的合理性分配。为课题开展1.3 #基于微服务的软件资源智能适配与动态互联中的智能软件单元部署的研究奠定了基础。|
|19|一种目标检测方法和检测系统 |江苏云从曦和人工智能有限公司#朱成宇 | 已授权 |202410666479.6 | 本发明涉及图像处理技术领域具体提供一种目标检测方法和检测系统。本发明目标检测方法包括基于目标检测模型的下采样次数获取每个检测头的识别面积根据所述检测头的识别面积得到每个检测头与所述目标检测模型输入图像的目标框的匹配度根据所述匹配度选取检测头基于选取的所述检测头调整所述目标检测模型输出目标检测的结果。本发明还包括对调整后的所述目标检测模型进行训练。本发明通过自适应多检测头的技术方案提高检测精度。采用自适应Focal-Loss的联合损失技术方案用于处理小目标问题提升目标检测性能。为课题开展1.3 #基于微服务的软件资源智能适配与动态互联中的智能软件单元部署的研究奠定了基础
| | | | | |

View File

@ -1,66 +1,62 @@
- # 课题四成果展示
<style>
/* 设置超链接的颜色为蓝色 */
a {
color: blue;
}
</style>
## [适配鹏城·脑海大模模型的对齐算法](https://openi.pcl.ac.cn/LLM-Research/RLHF/src/branch/master/algorithms/Reject-sampling%20RLHF)
* 开源简介本项目在脑海模型上实现了基于拒绝采样的对齐算法。对齐Alignment 是大语言模型训练全流程中至关重要的一步,其目的是让大模型与人类意图、价值观对齐,生成 有用的Useful、无害的Harmless和诚实的Honest 内容。在脑海大模型实践中,我们优先考虑的目标是让模型与社会主义核心价值观对齐,使其生成符合网信办合规要求的内容。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/LLM-Research/RLHF/src/branch/master/algorithms/Reject-sampling%20RLHF)
* 目录说明:目录"step1_supervised_finetuning"中为监督学习微调,目录"step2_reward_model_finetuning"为奖励模型训练,目录"step3_reject_sampling"为拒绝采样对齐。
## [离线强化学习框架ORPO](https://gitlink.org.cn/zyz-22029026/ORPO)
* 开源简介本项目实现了一个基于模型的离线强化学习算法框架ORPO (Optimistic Model Rollouts for Pessimistic Offline Policy Optimization, AAAI 2024),在被广泛使用的悲观离线策略优化中引入了基于模型的乐观采样方法。
* 项目链接:[开源链接](https://gitlink.org.cn/zyz-22029026/ORPO)
* 目录说明:目录"toy_exp"中为简单二维场景示例,目录"offlinerlkit"中为三种Mujoco场景下的算法实现目录"run_example"为执行算法的脚本。
## [固定翼飞机强化学习训练环境](https://openi.pcl.ac.cn/gongxudong/fly-craft)
* 开源简介:本项目提供了一个开源的固定翼飞机速度矢量控制强化学习环境,可用于研究使用强化学习进行固定翼飞机速度矢量控制的方法,也可以辅助进行通用强化学习算法的研究。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/gongxudong/fly-craft)
* 目录说明:目录"flycraft"中为本项目相关的开源内容。
## [固定翼飞机强化学习训练样例](https://openi.pcl.ac.cn/gongxudong/fly-craft-examples)
* 开源简介本项目提供了若干基于开源强化学习训练框架StableBaselines3与固定翼飞机强化学习训练环境FlyCraft进行强化学习训练的脚本样例。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/gongxudong/fly-craft-examples)
* 目录说明:目录"train_scripts"中为训练脚本样例目录“configs”中为算法配置文件目录“demonstrations”中为生成示范数据的脚本目录“utils_my”中为辅助工具脚本目录“test”为测试脚本。
## [基于非最优专家数据的强化学习策略优化方法](https://openi.pcl.ac.cn/gongxudong/IRPO)
* 开源简介:本项目提供了一种结合模仿学习与强化学习的训练框架,该框架能够基于非最优专家数据有效的进行强化学习策略的训练。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/gongxudong/IRPO)
* 目录说明:目录"train_scripts"中为训练脚本样例目录“configs”中为算法配置文件目录“demonstrations”中为生成示范数据的脚本目录“utils_my”中为辅助工具脚本。
## [基于不确定性的强化学习内在奖励方法](https://openi.pcl.ac.cn/Gaozijian/Dynamic_Memory_Based_Curiosity)
* 开源简介:本项目提供了一种结合不确定性评估与内在奖励的训练框架,该框架能够基于不确定性自监督地生成准确的内在奖励并引导智能体进行强化学习策略的训练,无需外在奖励的设计。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/Gaozijian/Dynamic_Memory_Based_Curiosity)
* 目录说明:目录"polices"中为内在奖励模型的网络结构文件,主目录下为代码的主运行文件及其他文件。
## [基于互补学习理论的强化学习内在奖励方法](https://openi.pcl.ac.cn/Gaozijian/COMPLEMENTARY_LEARNING_SYSTEM_BASED_INTRINSIC_REWARD)
* 开源简介:本项目提供了一种脑神经科学启发的互补学习理论框架与强化学习内在奖励的结合训练框架,该框架能够基于互补学习理论利用多个模型进行内在奖励地评估,并结合外在奖励对智能体进行强化学习策略的训练。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/Gaozijian/COMPLEMENTARY_LEARNING_SYSTEM_BASED_INTRINSIC_REWARD)
* 目录说明:目录"agent"中为不同的内在奖励模型的网络结构文件及参数文件,目录"custom_dmc_tasks"中为强化学习环境文件,主目录下为代码的主运行文件。
## [AI Service Engine](https://openi.pcl.ac.cn/xfyun/aiges)
* 开源简介AI Service EngineASE是一个专为AI能力开发者设计的全托管式AI算法引擎平台旨在通过云原生架构加速AI算法的云服务化简化部署、升级、扩缩和监控流程。ASE提供网络、分发策略、数据处理等辅助系统帮助开发者快速部署AI算法引擎。
* 项目链接:[开源链接1](https://openi.pcl.ac.cn/xfyun/aiges)[开源链接2](https://github.com/iflytek/aiges)
* 目录说明:目录"main"主目录下为代码的主运行文件。
- # 课题四成果展示
<style>
/* 设置超链接的颜色为蓝色 */
a {
color: blue;
}
</style>
## [适配鹏城·脑海大模模型的对齐算法](https://openi.pcl.ac.cn/LLM-Research/RLHF/src/branch/master/algorithms/Reject-sampling%20RLHF)
* 开源简介本项目在脑海模型上实现了基于拒绝采样的对齐算法。对齐Alignment 是大语言模型训练全流程中至关重要的一步,其目的是让大模型与人类意图、价值观对齐,生成 有用的Useful、无害的Harmless和诚实的Honest 内容。在脑海大模型实践中,我们优先考虑的目标是让模型与社会主义核心价值观对齐,使其生成符合网信办合规要求的内容。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/LLM-Research/RLHF/src/branch/master/algorithms/Reject-sampling%20RLHF)
* 目录说明:目录"step1_supervised_finetuning"中为监督学习微调,目录"step2_reward_model_finetuning"为奖励模型训练,目录"step3_reject_sampling"为拒绝采样对齐。
## [离线强化学习框架ORPO](https://gitlink.org.cn/zyz-22029026/ORPO)
* 开源简介本项目实现了一个基于模型的离线强化学习算法框架ORPO (Optimistic Model Rollouts for Pessimistic Offline Policy Optimization, AAAI 2024),在被广泛使用的悲观离线策略优化中引入了基于模型的乐观采样方法。
* 项目链接:[开源链接](https://gitlink.org.cn/zyz-22029026/ORPO)
* 目录说明:目录"toy_exp"中为简单二维场景示例,目录"offlinerlkit"中为三种Mujoco场景下的算法实现目录"run_example"为执行算法的脚本。
## [固定翼飞机强化学习训练环境](https://openi.pcl.ac.cn/gongxudong/fly-craft)
* 开源简介:本项目提供了一个开源的固定翼飞机速度矢量控制强化学习环境,可用于研究使用强化学习进行固定翼飞机速度矢量控制的方法,也可以辅助进行通用强化学习算法的研究。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/gongxudong/fly-craft)
* 目录说明:目录"flycraft"中为本项目相关的开源内容。
## [固定翼飞机强化学习训练样例](https://openi.pcl.ac.cn/gongxudong/fly-craft-examples)
* 开源简介本项目提供了若干基于开源强化学习训练框架StableBaselines3与固定翼飞机强化学习训练环境FlyCraft进行强化学习训练的脚本样例。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/gongxudong/fly-craft-examples)
* 目录说明:目录"train_scripts"中为训练脚本样例目录“configs”中为算法配置文件目录“demonstrations”中为生成示范数据的脚本目录“utils_my”中为辅助工具脚本目录“test”为测试脚本。
## [基于非最优专家数据的强化学习策略优化方法](https://openi.pcl.ac.cn/gongxudong/IRPO)
* 开源简介:本项目提供了一种结合模仿学习与强化学习的训练框架,该框架能够基于非最优专家数据有效的进行强化学习策略的训练。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/gongxudong/IRPO)
* 目录说明:目录"train_scripts"中为训练脚本样例目录“configs”中为算法配置文件目录“demonstrations”中为生成示范数据的脚本目录“utils_my”中为辅助工具脚本。
## [基于不确定性的强化学习内在奖励方法](https://openi.pcl.ac.cn/Gaozijian/Dynamic_Memory_Based_Curiosity)
* 开源简介:本项目提供了一种结合不确定性评估与内在奖励的训练框架,该框架能够基于不确定性自监督地生成准确的内在奖励并引导智能体进行强化学习策略的训练,无需外在奖励的设计。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/Gaozijian/Dynamic_Memory_Based_Curiosity)
* 目录说明:目录"polices"中为内在奖励模型的网络结构文件,主目录下为代码的主运行文件及其他文件。
## [基于互补学习理论的强化学习内在奖励方法](https://openi.pcl.ac.cn/Gaozijian/COMPLEMENTARY_LEARNING_SYSTEM_BASED_INTRINSIC_REWARD)
* 开源简介:本项目提供了一种脑神经科学启发的互补学习理论框架与强化学习内在奖励的结合训练框架,该框架能够基于互补学习理论利用多个模型进行内在奖励地评估,并结合外在奖励对智能体进行强化学习策略的训练。
* 项目链接:[开源链接](https://openi.pcl.ac.cn/Gaozijian/COMPLEMENTARY_LEARNING_SYSTEM_BASED_INTRINSIC_REWARD)
* 目录说明:目录"agent"中为不同的内在奖励模型的网络结构文件及参数文件,目录"custom_dmc_tasks"中为强化学习环境文件,主目录下为代码的主运行文件。
## [AI Service Engine](https://openi.pcl.ac.cn/xfyun/aiges)
* 开源简介AI Service EngineASE是一个专为AI能力开发者设计的全托管式AI算法引擎平台旨在通过云原生架构加速AI算法的云服务化简化部署、升级、扩缩和监控流程。ASE提供网络、分发策略、数据处理等辅助系统帮助开发者快速部署AI算法引擎。
* 项目链接:[开源链接1](https://openi.pcl.ac.cn/xfyun/aiges)[开源链接2](https://github.com/iflytek/aiges)
* 目录说明:目录"main"主目录下为代码的主运行文件。

View File

@ -7,36 +7,35 @@
}
</style>
#### 学术论文
以下学术论文,涵盖了复杂智能软件、人工智能、机器学习等领域的最新研究成果。
| 编号 | 标题 | 作者 | 发表时间 | 刊物/会议 | [链接](#) | 引用次数 |
| ---- | ------------------------------------------------------------ | ------------------------------------------------------------ | -------- | ------------------------------------------------------------ | ------------------------------------------------------------ | -------- |
| 1 | Multiple Temporal Fusion based Weakly-supervised Pretraining Techniques for Video Categorization | Xiaochen Cai、蔡恒兴、朱博青、许可乐、Weiwei Tu、冯大为 | 2022 | In Proceedings of the 30th ACM International Conference on Multimedia | [paper](https://dl.acm.org/doi/abs/10.1145/3503161.3551585) | |
| 2 | Masked modeling-based audio representation for ACM multimedia 2022 computational paralinguistics ChallengE | 游康、许可乐、朱博青、 王旭、 冯大为、 丁博、 王怀民 | 2022 | In Proceedings of the 30th ACM International Conference on Multimedia | [paper](https://dl.acm.org/doi/abs/10.1145/3503161.3551579) | |
| 3 | Complementary Learning System Based Intrinsic Reward In Reinforcement Learning | 高梓健、许可乐、 贾宏达、万天娇、 丁博、冯大为、毛新军、王怀民 | 2023 | IEEE International Conference on Acoustics, Speech, and Signal Processing | [paper](https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10095379) | |
| 4 | TensorFlow 开源软件社区中贡献修订的实证研究 | 李志星、余跃、王涛、蔡孟栾\王怀民 | 2023 | 软件学报 | [paper](https://jos.org.cn/html/2023/9/6873.htm) | |
| 5 | Understanding and Predicting Docker Build Duration: An Empirical Study of Containerized Workflow of OSS Projects | 吴逸文,张洋,许可乐,王涛,王怀民 | 2022 | ASE 2022 | [paper](https://dl.acm.org/doi/abs/10.1145/3551349.3556940) | |
| 6 | Progressive Diversifying Policy for Multi-Agent Reinforcement Learning | 孙绍奇,翟远钊,许可乐,冯大为,丁博 | 2023 | ICASSP 2024 | [paper](https://ieeexplore.ieee.org/abstract/document/10096125/) | |
| 7 | Optimistic Model Rollouts for Pessimistic Offline Policy Optimization | 翟远钊,李艺颖,高梓健,巩旭东,许可乐,冯大为,丁博,王怀民 | 2024 | AAAI 2024 | [paper](https://ojs.aaai.org/index.php/AAAI/article/view/29607/31026) | |
| 8 | How do Developers Talk about GitHub Actions? Evidence from Online Software Development Community | 张洋,吴逸文,陈婷婷,王涛,刘惠,王怀民 | 2024 | ICSE 2024 | [paper](https://dl.acm.org/doi/10.1145/3597503.3623327) | |
| 9 | Iterative Regularized Policy Optimization with Imperfect Demonstrations | 巩旭东,冯大为,许可乐,翟远钊,王维嘉,姚呈康,丁博,王怀民 | 2024 | ICML 2024 | [paper](https://openreview.net/pdf?id=Gp5F6qzwGK) | |
| 10 | Nuclear-Norm Maximization for Low-Rank Updates | 刘桓希,翟远钊,许可乐,冯大为,李艺颖 | 2024 | ICASSP 2024 | [paper](https://ieeexplore.ieee.org/abstract/document/10448410/) | |
| 11 | Temporal Inconsistency-based Active Learning | 万天娇,窦勇,许可乐,高梓健,丁博,冯大为,王怀民 | 2024 | ICASSP 2024 | [paper](https://ieeexplore.ieee.org/abstract/document/10446899/) | |
| 12 | FP4-Quantizatiion: Lossless 4bit Quantization For Large Language models | 王杰,刘桓希,冯大为,丁杰,丁博 | 2024 | JCC 2024 | [paper]() | |
| 13 | Dynamic Memory-Based Curiosity: A Bootstrap Approach for Exploration in Reinforcement Learning | 高梓健、李艺颖、许可乐、翟远钊、丁博、冯大为、毛新军、王怀民 | 2023 | IEEE Transactions on Emerging Topics in Computational Intelligence | [paper](https://ieeexplore.ieee.org/abstract/document/10347362) | |
| 14 | Self-Supervised Exploration via Temporal Inconsistency in Reinforcement Learning | 高梓健、许可乐、翟远钊、丁博、冯大为、毛新军、王怀民 | 2024 | IEEE Transactions on Artificial Intelligence | [paper](https://ieeexplore.ieee.org/abstract/document/10557253) | |
| 15 | Automated Data Augmentation for Audio Classification | 孙彦洁 、许可乐 、刘朝润 、窦勇 、王怀民 、 丁博 、潘青华 | 2024 | IEEE/ACM Transactions on Audio, Speech, and Language Processing | [paper](https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10531635) | |
| 16 | Voice-to-Face Generation: Couple of Self-Supervised Representation Learning with Diffusion Model | 陈武阳、许可乐、 窦勇、高天 | 2024 | International Conference on Multimedia and Expo | [paper](https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10687417) | |
| 17 | Goal-Conditioned On-Policy Reinforcement Learning | 巩旭东、冯大为、许可乐、丁博、王怀民 | 2024 | The Thirty-eighth Annual Conference on Neural Information Processing Systems | [paper](https://openreview.net/forum?id=KP7EUORJYI) | |
| 18 | A Survey of Deep Active Learning For Foundation Model | 万天娇、许可乐、 于婷、 王旭、 冯大为、 丁博、 王怀民 | 2023 | Intelligent Computing | [paper](https://spj.science.org/doi/pdf/10.34133/icomputing.0058) | |
| 19 | Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models | 翟远钊、杨廷楷、许可乐、冯大为、丁博、王怀民 | 2024 | Proceedings of the AAAI Conference on Artificial Intelligence | [paper](https://arxiv.org/pdf/2409.09345?) | |
| 20 | Diversifying Message Aggregation in Multi-Agent Communication Via Normalized Tensor Nuclear Norm Regularization | 翟远钊,许可乐,丁博,冯大为,高梓健,王怀民 | 2024 | ICASSP 2024 | [paper](https://ieeexplore.ieee.org/abstract/document/10096468/) | |
| 21 | Self-Supervised Learning-For Underwater Acoustic Signal Classification With Mixup | 徐齐胜、 姜晶菲、 许可乐、 窦勇、高彩丽、 朱博青、 游康、朱谦 | 2024 | IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing | [paper](https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10288071) | |
| 22 | Adapter-based Incremental Learning for Face Forgery Detection | 高彩丽、 徐齐胜、 乔鹏、 许可乐、 钱希福、 窦勇 | 2024 | IEEE International Conference on Acoustics, Speech and Signal Processing | [paper](https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10446543) | |
| 23 | VoiceStyle: Voice-Based Face Generation via Cross-Modal Prototype Contrastive Learning | 陈武阳、 朱博青、许可乐、窦勇、 冯大为 | 2024 | ACM Transactions on Multimedia Computing, Communications, and Applications | [paper](https://dl.acm.org/doi/10.1145/3671002) | |
| 24 | Enhanced Cross-Modal Transformer Model for Video Semantic Similarity Measurement | 李达、朱博青、许可乐、杨森、 冯大为、 刘波 | 2024 | IEEE Transactions on Circuits and Systems II: Express Briefs | [paper](https://scholar.google.com/scholar?hl=zh-CN&as_sdt=0%2C5&q=Enhanced+Cross-Modal+Transformer+Model+for+Video+Semantic+Similarity+Measurement&btnG=) | |
| 25 | Bi-Directional lnfluence and interaction for Multi-Agent Reinforcement Learning | 孙绍奇、许可乐、 冯大为、丁博 | 2024 | IEEE Transactions on Artificial Intelligence | [paper](https://www.computer.org/csdl/journal/ai/2024/10/10531155/1WXSUGwUPC0) | |
| 26 | Enhanced Cross-Modal Transformer Model for Video Semantic Similarity Measurement | 李达、朱博青、许可乐、杨森、 冯大为、 刘波 | 2024 | IEEE Transactions on Circuits and Systems II: Express Briefs | [paper](https://scholar.google.com/scholar?hl=zh-CN&as_sdt=0%2C5&q=Enhanced+Cross-Modal+Transformer+Model+for+Video+Semantic+Similarity+Measurement&btnG=) | |
| 编号 | 标题 | 作者 | 发表时间 | 刊物/会议 | [链接](#) | 引用次数|
| ------- | -------- | -------- | ------------- | --------- |--------- |--------- |
| 1 | Understanding and Predicting Docker Build Duration: An Empirical Study of Containerized Workflow of OSS Projects |吴逸文,张洋,许可乐,王涛,王怀民 | 2022 | ASE 2022 | [paper](https://dl.acm.org/doi/abs/10.1145/3551349.3556940) |
| 2|Optimistic Model Rollouts for Pessimistic Offline Policy Optimization | 翟远钊,李艺颖,高梓健,巩旭东,许可乐,冯大为,丁博,王怀民 | 2024 | AAAI 2024 | [paper](https://ojs.aaai.org/index.php/AAAI/article/view/29607/31026) |
| 3|How do Developers Talk about GitHub Actions? Evidence from Online Software Development Community | 张洋,吴逸文,陈婷婷,王涛,刘惠,王怀民 | 2024 | ICSE 2024 | [paper]() |
| 4|Iterative Regularized Policy Optimization with Imperfect Demonstrations | 巩旭东,冯大为,许可乐,翟远钊,王维嘉,姚呈康,丁博,王怀民 | 2024 | ICML 2024 | [paper](https://openreview.net/pdf?id=Gp5F6qzwGK) |
| 5|Diversifying Message Aggregation in Multi-Agent Communication Via Normalized Tensor Nuclear Norm Regularization | 翟远钊,许可乐,丁博,冯大为,高梓健,王怀民 | 2024 | ICASSP 2024 | [paper](https://ieeexplore.ieee.org/abstract/document/10096468/) |
| 6|Progressive Diversifying Policy for Multi-Agent Reinforcement Learning | 孙绍奇,翟远钊,许可乐,冯大为,丁博 | 2024 | ICASSP 2024 | [paper](https://ieeexplore.ieee.org/abstract/document/10096125/) |
| 7|Nuclear-Norm Maximization for Low-Rank Updates | 刘桓希,翟远钊,许可乐,冯大为,李艺颖 | 2024 | ICASSP 2024 |[paper](https://ieeexplore.ieee.org/abstract/document/10448410/) |
| 8|Temporal Inconsistency-based Active Learning | 万天娇,窦勇,许可乐,高梓健,丁博,冯大为,王怀民 | 2024 | ICASSP 2024 | [paper](https://ieeexplore.ieee.org/abstract/document/10446899/) |
| 9|FP4-Quantizatiion: Lossless 4bit Quantization For Large Language models | 王杰,刘桓希,冯大为,丁杰,丁博 | 2024 | JCC 2024 | [paper]() |
| 10|Dynamic Memory-Based Curiosity: A Bootstrap Approach for Exploration in Reinforcement Learning | 高梓健、李艺颖、许可乐、翟远钊、丁博、冯大为、毛新军、王怀民 | 2023 | IEEE Transactions on Emerging Topics in Computational Intelligence | [paper](https://ieeexplore.ieee.org/abstract/document/10347362) |
| 11|Self-Supervised Exploration via Temporal Inconsistency in Reinforcement Learning | 高梓健、许可乐、翟远钊、丁博、冯大为、毛新军、王怀民 | 2024 | IEEE Transactions on Artificial Intelligence | [paper](https://ieeexplore.ieee.org/abstract/document/10557253) |
| 12|Complementary Learning System Based Intrinsic Reward In Reinforcement Learning | 高梓健、许可乐、 贾宏达、万天娇、 丁博、冯大为、毛新军、王怀民 | 2023 | IEEE International Conference on Acoustics, Speech, and Signal Processing | [paper](https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10095379) |
| 13|Automated Data Augmentation for Audio Classification | 孙彦洁 、许可乐 、刘朝润 、窦勇 、王怀民 、 丁博 、潘青华 | 2024 | IEEE/ACM Transactions on Audio, Speech, and Language Processing | [paper](https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10531635) |
| 14|Self-Supervised Learning-For Underwater Acoustic Signal Classification With Mixup | 徐齐胜、 姜晶菲、 许可乐、 窦勇、高彩丽、 朱博青、 游康、朱谦 | 2024 | IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing | [paper](https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10288071) |
| 15|Adapter-based Incremental Learning for Face Forgery Detection | 高彩丽、 徐齐胜、 乔鹏、 许可乐、 钱希福、 窦勇 | 2024 | IEEE International Conference on Acoustics, Speech and Signal Processing | [paper](https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10446543) |
| 16|VoiceStyle: Voice-Based Face Generation via Cross-Modal Prototype Contrastive Learning | 陈武阳、 朱博青、许可乐、窦勇、 冯大为 | 2024| ACM Transactions on Multimedia Computing, Communications, and Applications| [paper](https://dl.acm.org/doi/10.1145/3671002) |
| 17|Voice-to-Face Generation: Couple of Self-Supervised Representation Learning with Diffusion Model | 陈武阳、许可乐、 窦勇、高天| 2024 | International Conference on Multimedia and Expo | [paper](https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10687417) |0 |
|18|Bi-Directional lnfluence and interaction for Multi-Agent Reinforcement Learning | 孙绍奇、许可乐、 冯大为、丁博 | 2024 |IEEE Transactions on Artificial Intelligence | [paper](https://www.computer.org/csdl/journal/ai/2024/10/10531155/1WXSUGwUPC0) |
| 19|A Survey of Deep Active Learning For Foundation Model | 万天娇、许可乐、 于婷、 王旭、 冯大为、 丁博、 王怀民 | 2023 | Intelligent Computing | [paper](https://spj.science.org/doi/pdf/10.34133/icomputing.0058) |
| 20|Multiple Temporal Fusion based Weakly-supervised Pretraining Techniques for Video Categorization | Xiaochen Cai、蔡恒兴、朱博青、许可乐、Weiwei Tu、冯大为 | 2022 | In Proceedings of the 30th ACM International Conference on Multimedia | [paper](https://dl.acm.org/doi/abs/10.1145/3503161.3551585) |
| 21| Masked modeling-based audio representation for ACM multimedia 2022 computational paralinguistics ChallengE | 游康、许可乐、朱博青、 王旭、 冯大为、 丁博、 王怀民 | 2022 | In Proceedings of the 30th ACM International Conference on Multimedia | [paper](https://dl.acm.org/doi/abs/10.1145/3503161.3551579) |
| 22| Enhanced Cross-Modal Transformer Model for Video Semantic Similarity Measurement | 李达、朱博青、许可乐、杨森、 冯大为、 刘波 | 2024 | IEEE Transactions on Circuits and Systems II: Express Briefs | [paper](https://scholar.google.com/scholar?hl=zh-CN&as_sdt=0%2C5&q=Enhanced+Cross-Modal+Transformer+Model+for+Video+Semantic+Similarity+Measurement&btnG=) |
|23 |Goal-Conditioned On-Policy Reinforcement Learning|巩旭东、冯大为、许可乐、丁博、王怀民|2024 | The Thirty-eighth Annual Conference on Neural Information Processing Systems|[paper](https://openreview.net/forum?id=KP7EUORJYI) |
|24 |Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models |翟远钊、杨廷楷、许可乐、冯大为、丁博、王怀民|2024 | Proceedings of the AAAI Conference on Artificial Intelligence|[paper](https://arxiv.org/pdf/2409.09345?) |

View File

@ -1,22 +1,23 @@
- # 课题四成果展示
#### 软件著作权
以下是软件著作权,这些软件在数据处理、图像识别等方面有广泛应用。
| 编号 | 软件名称 | 著作权人 | 受理时间 | 受理/登记号 | 简介 | [链接](#) |
| ---- | -------------------------------------------- | ---------------------------- | ---------------------- | --------------- | ---- | --------- |
| 1 | 智能业务流 | 江苏云从曦和人工智能有限公司 | 2023年05月 | 2023R11S0778807 | | |
| 2 | 容器镜像版本管理工具软件 | 国防科技大学 | 2023年06月 | 2023R11S0842730 | | |
| 3 | 智能微服务托管系统 | 科大讯飞股份有限公司 | 2023年06月 | 2023SR0797189 | | |
| 4 | 面向飞行控制场景的基于目标的强化学习环境软件 | 国防科技大学 | 2024年12月登记时间 | 2024SR2213246 | | |
| 5 | 多形态资源库版本管理系统 | 国防科技大学 | 2024年12月登记时间 | 2024SR2218301 | | |
| 6 | MLOps 训练引擎软件 | 国防科技大学 | 2024年12月登记时间 | 2024SR2218290 | | |
| 7 | 科大讯飞终端引擎托管平台 V1.0 | 科大讯飞股份有限公司 | 2024年8月 | 2024SR1317569 | | |
| 8 | 人机协同翻译系统 | 科大讯飞股份有限公司 | 2023年11月 | 2023SR1654904 | | |
| 9 | 科大讯飞谛听监控配置管理平台 V1.0 | 科大讯飞股份有限公司 | 2024年8月 | 2024SR1414335 | | |
| 10 | 仿真预测平台 V1.0 | 江苏云从曦和人工智能有限公司 | 2022年12月登记时间 | 2022SR1613483 | | |
| 11 | 数字人平台 V1.0 | 江苏云从曦和人工智能有限公司 | 2023年1月 (登记时间) | 2023SR0008642 | | |
| 12 | 智慧视觉应用分析平台 V1.0 | 江苏云从曦和人工智能有限公司 | 2022年12月登记时间 | 2022SR1590522 | | |
- # 课题四成果展示
#### 软件著作权
以下是软件著作权,这些软件在数据处理、图像识别等方面有广泛应用。
| 软件名称 | 著作权人 | 受理时间 | 受理/登记号 | 简介 | [链接](#) |
| --------- | -------- | -------- | ------------ | ---------------------------------- | --------- |
|智能业务流 | 江苏云从曦和人工智能有限公司 | 2023年05月 | 2023R11S0778807 |
|容器镜像版本管理工具软件 | 国防科技大学 | 2023年06月 | 2023R11S0842730 |
| 智能微服务托管系统 | 科大讯飞股份有限公司 | 2023年06月 | 2023SR0797189 |
|面向飞行控制场景的基于目标的强化学习环境软件 | 国防科技大学| 2024年12月登记时间 | 2024SR2213246 |
|多形态资源库版本管理系统 |国防科技大学 | 2024年12月登记时间 | 2024SR2218301 |
| MLOps 训练引擎软件 | 国防科技大学 | 2024年12月登记时间 |2024SR2218290 |
|科大讯飞终端引擎托管平台 V1.0 | 科大讯飞股份有限公司 | 2024年8月 | 2024SR1317569 |
|人机协同翻译系统 | 科大讯飞股份有限公司 | 2023年11月 | 2023SR1654904 |
|科大讯飞谛听监控配置管理平台 V1.0 | 科大讯飞股份有限公司 | 2024年8月 | 2024SR1414335 |
|仿真预测平台 V1.0 | 江苏云从曦和人工智能有限公司| 2022年12月登记时间 | 2022SR1613483 |
|数字人平台 V1.0 | 江苏云从曦和人工智能有限公司 | 2023年1月 (登记时间)| 2023SR0008642 |
|智慧视觉应用分析平台 V1.0 | 江苏云从曦和人工智能有限公司 | 2022年12月登记时间 | 2022SR1590522 |