HANS
Home
Demo
Blog
Plog
Résumé
Github
Demo
Blog
Plog
Résumé
Demo
Blog
Plog
Résumé
推理模型
推理模型的思维链评测与结果校验
March 16, 2025
AI
LLM
推理模型
评测
思维链
GRPO 入门:群体相对策略优化
March 2, 2025
AI
LLM
推理模型
GRPO
强化学习
DeepSeek-R1 的训练思路与开源影响
February 16, 2025
AI
LLM
DeepSeek
推理模型
强化学习
Test-time Compute:用更多推理换更高正确率
February 2, 2025
AI
LLM
推理模型
Test-time Compute
性能优化
推理模型兴起:为什么测试时计算开始变重要
January 5, 2025
AI
LLM
推理模型
Test-time Compute
发展史