全部文章 - 82
2026
Paper2PPT:从一篇论文到可编辑、可追溯 PPTX 的证据优先工作流
Paper2PPT:从一篇论文到可编辑、可追溯 PPTX 的证据优先工作流
Academic Paper Search:可复现的多源文献检索工作流
Academic Paper Search:可复现的多源文献检索工作流
PaperRefine:论文润色不只是换同义词,而是让主张回到证据边界
PaperRefine:论文润色不只是换同义词,而是让主张回到证据边界
SOL ENGINE:把 GPT-5.6 提示词优化变成可审计、可回归的工程流程
SOL ENGINE:把 GPT-5.6 提示词优化变成可审计、可回归的工程流程
WPIRONMAN Chat 正式上线:产品介绍与使用指南
WPIRONMAN Chat 正式上线:产品介绍与使用指南
我现在怎么做科研:从文献调研、实验到论文写作
我现在怎么做科研:从文献调研、实验到论文写作
我做了一个学术工作流助手:把选刊、前沿跟踪和 AI 预审串起来
我做了一个学术工作流助手:把选刊、前沿跟踪和 AI 预审串起来
层级结构 + 分布建模 + 原型演化
层级结构 + 分布建模 + 原型演化
Agentic RL:代码优先,理论辅助的实战法
Agentic RL:代码优先,理论辅助的实战法
Agentic RL:veRL AgentLoop 全流程与计算细节(Async Rollout、状态机、Tool-Interaction)
Agentic RL:veRL AgentLoop 全流程与计算细节(Async Rollout、状态机、Tool-Interaction)
Agentic RL:veRL Infra AgentLoop 代码串讲(Multi-turn 推理与 Ray Trainer)
Agentic RL:veRL Infra AgentLoop 代码串讲(Multi-turn 推理与 Ray Trainer)
Agentic RL:veRL Infra AgentLoop(AgentLoopManager、Async Rollout 与 Hybrid 推训)
Agentic RL:veRL Infra AgentLoop(AgentLoopManager、Async Rollout 与 Hybrid 推训)
Agentic RL:重新理解 DPO(KL 正则 RL、隐式奖励模型与缺陷)
Agentic RL:重新理解 DPO(KL 正则 RL、隐式奖励模型与缺陷)
Agentic RL:分布视角理解 SFT 与 RL(Forward/Reverse KL、分布与奖励)
Agentic RL:分布视角理解 SFT 与 RL(Forward/Reverse KL、分布与奖励)
Agentic RL:Reward Model Insights(Bradley-Terry、MLE 与深度学习)
Agentic RL:Reward Model Insights(Bradley-Terry、MLE 与深度学习)
Agentic RL:Tokenizer 编解码非对称性与 Token-in-Token-out(RL 训练崩溃的根因)
Agentic RL:Tokenizer 编解码非对称性与 Token-in-Token-out(RL 训练崩溃的根因)
Agentic RL:veRL MultiTurn Tool Use 与 Coding Agent SFT(Cold Start for RL)
Agentic RL:veRL MultiTurn Tool Use 与 Coding Agent SFT(Cold Start for RL)
Agentic RL:veRL FSDP SFT Trainer 补充(Teacher Forcing、Shift Labels/Logits、Loss Mask)
Agentic RL:veRL FSDP SFT Trainer 补充(Teacher Forcing、Shift Labels/Logits、Loss Mask)
Agentic RL:veRL FSDP SFT Trainer(SFT vs RL、交叉熵损失、Loss Mask、LR Scheduler)
Agentic RL:veRL FSDP SFT Trainer(SFT vs RL、交叉熵损失、Loss Mask、LR Scheduler)
Agentic RL:veRL 核心强化学习算法(GRPO、RLOO、REINFORCE++)与 Baseline 设计
Agentic RL:veRL 核心强化学习算法(GRPO、RLOO、REINFORCE++)与 Baseline 设计