烨川南
码龄6年
求更新 关注
提问 私信
  • 博客:22,438
    22,438
    总访问量
  • 20
    原创
  • 137
    粉丝
  • 38
    关注
IP属地以运营商信息为准,境内显示到省(区、市),境外显示到国家(地区)
IP 属地:天津市
加入CSDN时间: 2021-03-23
博客简介:

只是个人学习笔记

查看详细资料
个人成就
  • 获得430次点赞
  • 内容获得1次评论
  • 获得379次收藏
  • 博客总排名1,500,210名
创作历程
  • 18篇
    2025年
  • 2篇
    2024年
成就勋章
TA的专栏
  • 强化学习
    13篇
  • python
    4篇
  • 前端
    1篇
  • JavaScript
  • 问题解决
    1篇
兴趣领域 设置
  • 人工智能
    深度学习自动驾驶
创作活动更多

【多重好礼】鸿蒙心迹 · 开发录原创征稿活动

鸿蒙开发者的实战经验,值得被记录。从踩坑排查到项目复盘,从工具脚本到学习笔记,每一段真实的开发经历,都是社区最宝贵的技术资产。「鸿蒙心迹 · 开发录」正式启航,不限主题、随时可写,只要是鸿蒙开发相关的真实经验都欢迎投稿。 本活动为 [HarmonyOS 7.0 创新内容共创季](https://builderx.csdn.net/activity-site/harmonyos/activity2026)双轨征文之一,与[「共创季 · 稿事节」](https://harmonyosdev.csdn.net/6a97f0de2b83d06f0ecadec5.html)深度征文互补——「稿事节」写深度技术长文,「开发录」写日常开发实战笔记。 「开发录」每月一期,12月截止,本季共三期,投稿即有机会获得京东卡、CSDN博客流量券、亿万Token、社区定制周边好礼!

126人参与 去参加
  • 最近
  • 文章
  • 专栏
  • 收藏
  • 最近

  • 文章

  • 专栏

  • 收藏

搜索 取消

强化学习:Distributed PPO (DPPO) 学习笔记

DPPO = Distributed + Proximal Policy OptimizationDistributed:多个智能体并行训练Proximal:限制策略更新幅度,确保稳定性Policy Optimization:基于策略梯度的优化方法核心思想:多个智能体并行探索环境,共享经验,通过裁剪策略更新确保训练稳定
原创
博文更新于 2025.07.07 ·
1301 阅读 ·
25 点赞 ·
0 评论 ·
14 收藏

强化学习:Proximal Policy Optimization(PPO)学习笔记

PPO(Proximal Policy Optimization)是一种用于优化策略网络的无模型强化学习算法,由OpenAI在2017年提出。它的主要目标是在不进行大量样本交互的情况下,高效地更新策略网络,同时避免策略更新过程中出现过大的策略变化,从而提高训练的稳定性和效率。PPO有两种主要的实现方式:基于KL散度惩罚(KL penalty)和裁剪代理目标(Clipped surrogate objective),本代码中使用的是裁剪代理目标的方法。
原创
博文更新于 2025.07.07 ·
1131 阅读 ·
16 点赞 ·
0 评论 ·
7 收藏

Python 03 (判断语句)

在程序设计中,判断语句是基础且核心的部分,它能让程序根据不同条件执行不同操作。
原创
博文更新于 2025.07.04 ·
1578 阅读 ·
41 点赞 ·
0 评论 ·
45 收藏

HTML基础01:元素分类与常见标签详解

作为HTML小白,理解元素分类和常见标签是入门的关键。HTML元素主要分为块级元素、行块级元素(也叫行内块元素)和行级元素(也叫行内元素),它们各自有着独特的显示和属性设置特点。
原创
博文更新于 2025.07.04 ·
668 阅读 ·
3 点赞 ·
0 评论 ·
8 收藏

Python 02 (Python基础语法学习)

在Python程序里,变量是一种在程序运行时用于存储数据的载体,它就像是一个“容器”。变量名 = 变量值。这里的“=”被称为赋值运算符,它的作用是把等号右边的值存储到左边的变量中。比如age = 18,“age”就是变量名,它是这个“容器”的标识,方便在程序的其他地方使用这个变量;“18”是变量值,也就是存放在“容器”里的数据。在Python程序中,给变量、方法、类等起的名字统称为标识符,用于标识这些内容。单引号定义法'字符串'。若字符串含单引号,需用转义。text1 = '普通字符串'
原创
博文更新于 2025.07.04 ·
1624 阅读 ·
53 点赞 ·
0 评论 ·
31 收藏

Python 01 (新手小白入门+安装笔记)

Python 入门知识
原创
博文更新于 2025.07.04 ·
1215 阅读 ·
27 点赞 ·
0 评论 ·
41 收藏

强化学习:Asynchronous Advantage Actor-Critic (A3C) 学习笔记

Asynchronous Advantage Actor-Critic (A3C) 是一种高效的分布式强化学习算法,通过并行训练多个智能体提高样本效率和训练稳定性。
原创
博文更新于 2025.07.04 ·
454 阅读 ·
5 点赞 ·
0 评论 ·
4 收藏

强化学习:Deep Deterministic Policy Gradient (DDPG) 学习笔记

DDPG 是一种无模型、离线策略(off-policy)的 Actor-Critic 算法,专为连续动作空间设计。
原创
博文更新于 2025.07.03 ·
1125 阅读 ·
18 点赞 ·
0 评论 ·
30 收藏

强化学习:Actor Critic 学习笔记

Actor Critic(演员-评论家)算法是强化学习中的经典策略梯度方法,通过结合策略网络(Actor)和值网络(Critic),平衡了样本效率和学习稳定性。
原创
博文更新于 2025.07.02 ·
1297 阅读 ·
26 点赞 ·
0 评论 ·
24 收藏

强化学习:Policy Gradients 学习笔记

Policy Gradient(基于 Softmax 的策略梯度算法)是强化学习中的经典策略梯度方法,通过直接优化策略函数来最大化累积奖励。
原创
博文更新于 2025.07.01 ·
1874 阅读 ·
24 点赞 ·
0 评论 ·
28 收藏

强化学习:Dueling DQN 学习笔记

Dueling DQN(竞争型深度 Q 网络)是 DQN 的重要改进,通过将 Q 值分解为状态价值函数(V)和优势函数(A),提高对状态价值和动作优势的建模能力。
原创
博文更新于 2025.07.01 ·
966 阅读 ·
14 点赞 ·
0 评论 ·
16 收藏

Python 04 (循环语句)

python 循环语句
原创
博文更新于 2025.06.30 ·
1154 阅读 ·
26 点赞 ·
0 评论 ·
9 收藏

强化学习:Prioritized Experience Replay 学习笔记

Prioritized Experience Replay(PER)是强化学习的智能记忆管理技术。它通过TD-error(预测误差) 评估经验价值,优先学习高误差样本。核心创新是SumTree数据结构,实现O(logN)高效抽样。结合重要性采样权重避免偏差,显著提升训练效率。
原创
博文更新于 2025.06.29 ·
1098 阅读 ·
39 点赞 ·
0 评论 ·
25 收藏

强化学习:Double DQN 学习笔记

Double DQN 针对 DQN 的高估偏差问题提出改进。核心思想是解耦动作选择与价值评估。
原创
博文更新于 2025.06.29 ·
960 阅读 ·
24 点赞 ·
0 评论 ·
8 收藏

强化学习:DQN (Deep Q-Network) 学习笔记

DQN(深度Q网络)将深度神经网络引入Q-learning,解决高维状态空间的维度灾难问题。其核心创新为:经验回放和目标网络。通过ε-贪婪策略平衡探索与利用,实现端到端学习。在Atari游戏中首次超越人类表现,奠定深度强化学习基石,但存在训练不稳定、高估偏差等局限。
原创
博文更新于 2025.06.25 ·
1024 阅读 ·
8 点赞 ·
0 评论 ·
28 收藏

强化学习:Sarsa、Sarsa(λ) 学习笔记

Sarsa 是在线策略强化学习算法,通过状态-动作对 (s,a,r,s',a') 更新 Q 值,与 Q-learning 区别在于更新时用实际选的下一个动作 a' 而非最大 Q 值动作,更保守。Sarsa(λ) 引入资格迹,使奖励影响之前状态-动作对。
原创
博文更新于 2025.06.23 ·
1027 阅读 ·
14 点赞 ·
0 评论 ·
13 收藏

强化学习:Q-learning 学习笔记

Q-learning是一种强化学习算法,旨在通过与环境交互让智能体学会最优决策策略。其核心在于学习Q值表,用于评估特定状态下采取某个动作的长期价值。
原创
博文更新于 2025.06.21 ·
1926 阅读 ·
27 点赞 ·
0 评论 ·
33 收藏

强化学习简介

强化学习是机器学习分支,通过与环境交互试错学习,依奖励调整策略。算法分价值(如 Q 学习、DQN)、策略(如 Policy Gradients)、模型(Model-based)三类,可从环境理解、决策依据等维度分类。近年与深度学习结合,在游戏(如 AlphaGo)等领域应用广泛,学习不依赖特定模块,适合初学者掌握底层原理。
原创
博文更新于 2025.06.20 ·
807 阅读 ·
15 点赞 ·
0 评论 ·
7 收藏

在vue表单渲染渲染数显示Invalid prop: custom validator check failed for prop “index“.

Invalid prop: custom validator check failed for prop "index".解决
原创
博文更新于 2024.06.05 ·
527 阅读 ·
15 点赞 ·
1 评论 ·
5 收藏

arguments用法介绍

arguments 用法介绍
原创
博文更新于 2024.06.04 ·
656 阅读 ·
9 点赞 ·
0 评论 ·
1 收藏
加载更多