
  <rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
      <title>HANS</title>
      <link>https://www.hansking.cn/blog</link>
      <description>A posts created with Next.js and Tailwind.css</description>
      <language>en-us</language>
      <managingEditor>admin@hansking.cn (HANS)</managingEditor>
      <webMaster>admin@hansking.cn (HANS)</webMaster>
      <lastBuildDate>Sun, 09 Nov 2025 10:00:00 GMT</lastBuildDate>
      <atom:link href="https://www.hansking.cn/tags/性能优化/feed.xml" rel="self" type="application/rss+xml"/>
      
  <item>
    <guid>https://www.hansking.cn/blog/2026/FlashAttention-zhu-yi-li-ji-suan-de-IO-you-hua</guid>
    <title>FlashAttention：注意力计算的 IO 优化</title>
    <link>https://www.hansking.cn/blog/2026/FlashAttention-zhu-yi-li-ji-suan-de-IO-you-hua</link>
    <description>[{&quot;value&quot;:&quot;FlashAttention：注意力计算的 IO 优化&quot;,&quot;url&quot;:&quot;#flashattention注意力计算的-io-优化&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、标准注意力为什么占内存&quot;,&quot;url&quot;:&quot;#一标准注意力为什么占内存&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、GPU 有很多层存储&quot;,&quot;url&quot;:&quot;#二gpu-有很多层存储&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、分块计算怎么保持正确结果&quot;,&quot;url&quot;:&quot;#三分块计算怎么保持正确结果&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、因果 Mask 和变长序列&quot;,&quot;url&quot;:&quot;#四因果-mask-和变长序列&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、它优化的是 IO，不是把复杂度变成线性&quot;,&quot;url&quot;:&quot;#五它优化的是-io不是把复杂度变成线性&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、为什么实际速度可能没有论文那么快&quot;,&quot;url&quot;:&quot;#六为什么实际速度可能没有论文那么快&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、使用时先确认版本和回退路径&quot;,&quot;url&quot;:&quot;#七使用时先确认版本和回退路径&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、和量化、KV Cache 一起看&quot;,&quot;url&quot;:&quot;#八和量化kv-cache-一起看&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、从工程角度如何判断值得使用&quot;,&quot;url&quot;:&quot;#九从工程角度如何判断值得使用&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;总结：性能优化常常是少搬数据&quot;,&quot;url&quot;:&quot;#总结性能优化常常是少搬数据&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 09 Nov 2025 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>FlashAttention</category><category>GPU</category><category>性能优化</category>
  </item>

  <item>
    <guid>https://www.hansking.cn/blog/2026/On-deviceAI-duan-ce-tui-li-de-xing-neng-yu-yin-si-quan-heng</guid>
    <title>On-device AI：端侧推理的性能与隐私权衡</title>
    <link>https://www.hansking.cn/blog/2026/On-deviceAI-duan-ce-tui-li-de-xing-neng-yu-yin-si-quan-heng</link>
    <description>[{&quot;value&quot;:&quot;On-device AI：端侧推理的性能与隐私权衡&quot;,&quot;url&quot;:&quot;#on-device-ai端侧推理的性能与隐私权衡&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、先决定哪些任务值得放到设备端&quot;,&quot;url&quot;:&quot;#一先决定哪些任务值得放到设备端&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、先做内存预算，再谈模型大小&quot;,&quot;url&quot;:&quot;#二先做内存预算再谈模型大小&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、量化不是免费午餐&quot;,&quot;url&quot;:&quot;#三量化不是免费午餐&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、推理优化的第一目标是减少等待&quot;,&quot;url&quot;:&quot;#四推理优化的第一目标是减少等待&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、端侧隐私强，但不是天然安全&quot;,&quot;url&quot;:&quot;#五端侧隐私强但不是天然安全&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、模型文件也需要保护&quot;,&quot;url&quot;:&quot;#六模型文件也需要保护&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、端云路由需要可解释&quot;,&quot;url&quot;:&quot;#七端云路由需要可解释&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、我建议用一张设备矩阵收尾&quot;,&quot;url&quot;:&quot;#八我建议用一张设备矩阵收尾&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;总结：端侧 AI 的价值来自克制&quot;,&quot;url&quot;:&quot;#总结端侧-ai-的价值来自克制&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Wed, 22 Apr 2026 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>On-device AI</category><category>端侧推理</category><category>性能优化</category>
  </item>

  <item>
    <guid>https://www.hansking.cn/blog/2026/SpeculativeDecoding-yong-xiao-mo-xing-jia-su-da-mo-xing</guid>
    <title>Speculative Decoding：用小模型加速大模型</title>
    <link>https://www.hansking.cn/blog/2026/SpeculativeDecoding-yong-xiao-mo-xing-jia-su-da-mo-xing</link>
    <description>[{&quot;value&quot;:&quot;Speculative Decoding：用小模型加速大模型&quot;,&quot;url&quot;:&quot;#speculative-decoding用小模型加速大模型&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、为什么自回归生成慢&quot;,&quot;url&quot;:&quot;#一为什么自回归生成慢&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、基本流程是什么&quot;,&quot;url&quot;:&quot;#二基本流程是什么&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、小模型不需要和大模型一样聪明&quot;,&quot;url&quot;:&quot;#三小模型不需要和大模型一样聪明&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、速度收益取决于接受率&quot;,&quot;url&quot;:&quot;#四速度收益取决于接受率&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、为什么结果可以保持目标模型分布&quot;,&quot;url&quot;:&quot;#五为什么结果可以保持目标模型分布&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、KV Cache 管理决定能不能跑得快&quot;,&quot;url&quot;:&quot;#六kv-cache-管理决定能不能跑得快&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、不同任务的收益不同&quot;,&quot;url&quot;:&quot;#七不同任务的收益不同&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、工程上常见的失败原因&quot;,&quot;url&quot;:&quot;#八工程上常见的失败原因&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;1. 草稿模型太慢&quot;,&quot;url&quot;:&quot;#1-草稿模型太慢&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;2. Tokenizer 不兼容&quot;,&quot;url&quot;:&quot;#2-tokenizer-不兼容&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;3. 采样参数不一致&quot;,&quot;url&quot;:&quot;#3-采样参数不一致&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;4. 并发下显存不足&quot;,&quot;url&quot;:&quot;#4-并发下显存不足&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;5. 只测平均值&quot;,&quot;url&quot;:&quot;#5-只测平均值&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;九、上线前怎么评估&quot;,&quot;url&quot;:&quot;#九上线前怎么评估&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;总结：让小模型猜，让大模型负责&quot;,&quot;url&quot;:&quot;#总结让小模型猜让大模型负责&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 26 Oct 2025 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>Speculative Decoding</category><category>推理优化</category><category>性能优化</category>
  </item>

  <item>
    <guid>https://www.hansking.cn/blog/2026/Test-timeCompute-yong-geng-duo-tui-li-huan-geng-gao-zheng-que-l</guid>
    <title>Test-time Compute：用更多推理换更高正确率</title>
    <link>https://www.hansking.cn/blog/2026/Test-timeCompute-yong-geng-duo-tui-li-huan-geng-gao-zheng-que-l</link>
    <description>[{&quot;value&quot;:&quot;Test-time Compute：用更多推理换更高正确率&quot;,&quot;url&quot;:&quot;#test-time-compute用更多推理换更高正确率&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、训练时计算和推理时计算有什么不同&quot;,&quot;url&quot;:&quot;#一训练时计算和推理时计算有什么不同&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、最简单的方式：Best-of-N&quot;,&quot;url&quot;:&quot;#二最简单的方式best-of-n&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、自洽性不是简单投票&quot;,&quot;url&quot;:&quot;#三自洽性不是简单投票&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、搜索与分支：把答案当成一个小型搜索问题&quot;,&quot;url&quot;:&quot;#四搜索与分支把答案当成一个小型搜索问题&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、动态预算比固定长思考更合理&quot;,&quot;url&quot;:&quot;#五动态预算比固定长思考更合理&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、推理时计算的成本怎么算&quot;,&quot;url&quot;:&quot;#六推理时计算的成本怎么算&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、质量收益必须通过对照实验证明&quot;,&quot;url&quot;:&quot;#七质量收益必须通过对照实验证明&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、什么时候不值得使用更多计算&quot;,&quot;url&quot;:&quot;#八什么时候不值得使用更多计算&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、生产环境必须设置护栏&quot;,&quot;url&quot;:&quot;#九生产环境必须设置护栏&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十、我的总结：把计算当成预算，而不是信仰&quot;,&quot;url&quot;:&quot;#十我的总结把计算当成预算而不是信仰&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 02 Feb 2025 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>推理模型</category><category>Test-time Compute</category><category>性能优化</category>
  </item>

    </channel>
  </rss>
