avatar
文章
85
标签
200
分类
22
首页
分类
项目
  • 项目主页
  • 学术助手
  • 智会助手
  • Codex Remote PWA
  • 技能集
  • AI知识星系
  • 工地检测
  • AI中转控制台
  • WPIRONMAN Chat
友链
  • 本站友链
  • 随机开往
  • 异次元之旅
学术主页
关于
LogoWPIRONMAN
搜索
首页
分类
项目
  • 项目主页
  • 学术助手
  • 智会助手
  • Codex Remote PWA
  • 技能集
  • AI知识星系
  • 工地检测
  • AI中转控制台
  • WPIRONMAN Chat
友链
  • 本站友链
  • 随机开往
  • 异次元之旅
学术主页
关于

算法解析

分类 - 算法解析
2026
Agentic RL:代码优先,理论辅助的实战法
2026-02-26
Agentic RL:代码优先,理论辅助的实战法
Agentic RL:veRL AgentLoop 全流程与计算细节(Async Rollout、状态机、Tool-Interaction)
2026-02-10
Agentic RL:veRL AgentLoop 全流程与计算细节(Async Rollout、状态机、Tool-Interaction)
Agentic RL:veRL Infra AgentLoop 代码串讲(Multi-turn 推理与 Ray Trainer)
2026-02-10
Agentic RL:veRL Infra AgentLoop 代码串讲(Multi-turn 推理与 Ray Trainer)
Agentic RL:veRL Infra AgentLoop(AgentLoopManager、Async Rollout 与 Hybrid 推训)
2026-02-10
Agentic RL:veRL Infra AgentLoop(AgentLoopManager、Async Rollout 与 Hybrid 推训)
Agentic RL:重新理解 DPO(KL 正则 RL、隐式奖励模型与缺陷)
2026-02-10
Agentic RL:重新理解 DPO(KL 正则 RL、隐式奖励模型与缺陷)
Agentic RL:分布视角理解 SFT 与 RL(Forward/Reverse KL、分布与奖励)
2026-02-10
Agentic RL:分布视角理解 SFT 与 RL(Forward/Reverse KL、分布与奖励)
Agentic RL:Reward Model Insights(Bradley-Terry、MLE 与深度学习)
2026-02-10
Agentic RL:Reward Model Insights(Bradley-Terry、MLE 与深度学习)
Agentic RL:veRL 核心强化学习算法(GRPO、RLOO、REINFORCE++)与 Baseline 设计
2026-02-09
Agentic RL:veRL 核心强化学习算法(GRPO、RLOO、REINFORCE++)与 Baseline 设计
Agentic RL:veRL(verl)训练参数理解(PPO & GRPO、Batch Size、KL & Entropy)
2026-02-09
Agentic RL:veRL(verl)训练参数理解(PPO & GRPO、Batch Size、KL & Entropy)
Agentic RL:REINFORCE 4 LLM(Reward 设计与 PG+KL Loss 细节)
2026-02-09
Agentic RL:REINFORCE 4 LLM(Reward 设计与 PG+KL Loss 细节)
Agentic RL:系列导航(PG Loss、TRPO、PPO-Clip)
2026-02-09
Agentic RL:系列导航(PG Loss、TRPO、PPO-Clip)
Agentic RL:从 PG 到 TRPO 到 PPO-Clip(推导与代码对齐)
2026-02-09
Agentic RL:从 PG 到 TRPO 到 PPO-Clip(推导与代码对齐)
Agentic RL:PG Loss 组件详解(PPO-clip / Dual-Clip / Entropy / KL / 聚合)
2026-02-09
Agentic RL:PG Loss 组件详解(PPO-clip / Dual-Clip / Entropy / KL / 聚合)
2025
深度学习优化器全家桶:从 SGD 到 AdamW 及未来
2025-12-03
深度学习优化器全家桶:从 SGD 到 AdamW 及未来
深度学习损失函数:从 MSE 到 Focal Loss
2025-12-03
深度学习损失函数:从 MSE 到 Focal Loss
1
avatar
WP
无业游民
文章
85
标签
200
分类
22
Follow Me
公告
学术助手已上线
期刊会议检索、前沿论文浏览和 AI 预审入口已经接进博客。
立即进入
最新文章
开题检索怎么做:用 Codex / Claude Code 留下一份可复查的文献初筛
开题检索怎么做:用 Codex / Claude Code 留下一份可复查的文献初筛2026-07-31
AI 给的论文引用是真的吗?用 DOI / PMID 做四状态核验
AI 给的论文引用是真的吗?用 DOI / PMID 做四状态核验2026-07-31
PubMed 检索别只堆关键词:从 MeSH 核对到可复用检索式
PubMed 检索别只堆关键词:从 MeSH 核对到可复用检索式2026-07-31
Paper2PPT:从一篇论文到可编辑、可追溯 PPTX 的证据优先工作流
Paper2PPT:从一篇论文到可编辑、可追溯 PPTX 的证据优先工作流2026-07-18
分类
  • 学术思考2
  • 工程实践15
    • 强化学习5
    • 科研方法4
  • 强化学习数学原理12
  • 手撕代码2
    • 图像分类2
  • 数据结构与算法7
标签
Probability RLOO Python Preference Optimization 算法详解 Monte Carlo 双端队列 Policy Gradient queue STL 排序 Robbins-Monro 队列 string 剪枝 Perplexity A2C 二叉树 检索策略 PubMed 堆排序 Reward Model Vision Transformer Ray 随笔 REINFORCE++ Martingale Function Approximation 绪论 Roadmap 快速排序 Resnet KL Baseline Agent Skills deque 研究生生活 图论 性能优化 Agent
归档
  • 七月 2026 8
  • 四月 2026 3
  • 二月 2026 32
  • 十二月 2025 5
  • 十一月 2025 8
  • 九月 2025 2
  • 六月 2025 1
  • 四月 2025 5
网站信息
文章数目 :
85
运行时间 :
本站总字数 :
189.4k
最后更新时间 :
总访问量:
加载中...
©2025 - 2026 By WP
框架 Hexo|主题 Butterfly
搜索
数据加载中

从关键词开始检索文章

适合查找算法笔记、强化学习推导、科研工作流和项目入口。