
  <rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
      <title>HANS</title>
      <link>https://www.hansking.cn/blog</link>
      <description>A posts created with Next.js and Tailwind.css</description>
      <language>en-us</language>
      <managingEditor>admin@hansking.cn (HANS)</managingEditor>
      <webMaster>admin@hansking.cn (HANS)</webMaster>
      <lastBuildDate>Mon, 15 Jun 2026 10:00:00 GMT</lastBuildDate>
      <atom:link href="https://www.hansking.cn/tags/GPU/feed.xml" rel="self" type="application/rss+xml"/>
      
  <item>
    <guid>https://www.hansking.cn/blog/2026/AI-xi-tong-cheng-ben-he-suan-TokenGPU-cun-chu-yu-ren-gong-cheng-ben</guid>
    <title>AI 系统成本核算：Token、GPU、存储与人工成本</title>
    <link>https://www.hansking.cn/blog/2026/AI-xi-tong-cheng-ben-he-suan-TokenGPU-cun-chu-yu-ren-gong-cheng-ben</link>
    <description>[{&quot;value&quot;:&quot;AI 系统成本核算：Token、GPU、存储与人工成本&quot;,&quot;url&quot;:&quot;#ai-系统成本核算tokengpu存储与人工成本&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、先算一次“成功任务”的成本&quot;,&quot;url&quot;:&quot;#一先算一次成功任务的成本&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、Token 成本不只取决于用户说了多少话&quot;,&quot;url&quot;:&quot;#二token-成本不只取决于用户说了多少话&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、Embedding 和索引是容易被漏算的长期成本&quot;,&quot;url&quot;:&quot;#三embedding-和索引是容易被漏算的长期成本&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、自建 GPU 不能只除以运行小时&quot;,&quot;url&quot;:&quot;#四自建-gpu-不能只除以运行小时&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、缓存是成本优化，也是数据边界&quot;,&quot;url&quot;:&quot;#五缓存是成本优化也是数据边界&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、把人工成本放进模型里&quot;,&quot;url&quot;:&quot;#六把人工成本放进模型里&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、成本归因要能定位到功能和租户&quot;,&quot;url&quot;:&quot;#七成本归因要能定位到功能和租户&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、优化顺序：先消除浪费，再换模型&quot;,&quot;url&quot;:&quot;#八优化顺序先消除浪费再换模型&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;总结：便宜不是目标，单位价值才是&quot;,&quot;url&quot;:&quot;#总结便宜不是目标单位价值才是&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Mon, 15 Jun 2026 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>成本优化</category><category>GPU</category><category>工程实践</category>
  </item>

  <item>
    <guid>https://www.hansking.cn/blog/2026/ContinuousBatching-yu-fu-wu-bing-fa</guid>
    <title>Continuous Batching 与服务并发</title>
    <link>https://www.hansking.cn/blog/2026/ContinuousBatching-yu-fu-wu-bing-fa</link>
    <description>[{&quot;value&quot;:&quot;Continuous Batching 与服务并发&quot;,&quot;url&quot;:&quot;#continuous-batching-与服务并发&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、静态 Batch 为什么浪费&quot;,&quot;url&quot;:&quot;#一静态-batch-为什么浪费&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、Continuous Batching 如何动态加入请求&quot;,&quot;url&quot;:&quot;#二continuous-batching-如何动态加入请求&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、Prefill 和 Decode 是两种不同工作&quot;,&quot;url&quot;:&quot;#三prefill-和-decode-是两种不同工作&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、KV Cache 是并发的硬约束&quot;,&quot;url&quot;:&quot;#四kv-cache-是并发的硬约束&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、调度目标不只有吞吐&quot;,&quot;url&quot;:&quot;#五调度目标不只有吞吐&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、队列和背压要尽早生效&quot;,&quot;url&quot;:&quot;#六队列和背压要尽早生效&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、不同请求不要互相拖累&quot;,&quot;url&quot;:&quot;#七不同请求不要互相拖累&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、流式输出不能掩盖调度问题&quot;,&quot;url&quot;:&quot;#八流式输出不能掩盖调度问题&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、压测要模拟真实长度分布&quot;,&quot;url&quot;:&quot;#九压测要模拟真实长度分布&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;总结：并发优化是在安排等待&quot;,&quot;url&quot;:&quot;#总结并发优化是在安排等待&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 12 Oct 2025 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>Continuous Batching</category><category>GPU</category><category>并发优化</category>
  </item>

  <item>
    <guid>https://www.hansking.cn/blog/2026/FlashAttention-zhu-yi-li-ji-suan-de-IO-you-hua</guid>
    <title>FlashAttention：注意力计算的 IO 优化</title>
    <link>https://www.hansking.cn/blog/2026/FlashAttention-zhu-yi-li-ji-suan-de-IO-you-hua</link>
    <description>[{&quot;value&quot;:&quot;FlashAttention：注意力计算的 IO 优化&quot;,&quot;url&quot;:&quot;#flashattention注意力计算的-io-优化&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、标准注意力为什么占内存&quot;,&quot;url&quot;:&quot;#一标准注意力为什么占内存&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、GPU 有很多层存储&quot;,&quot;url&quot;:&quot;#二gpu-有很多层存储&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、分块计算怎么保持正确结果&quot;,&quot;url&quot;:&quot;#三分块计算怎么保持正确结果&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、因果 Mask 和变长序列&quot;,&quot;url&quot;:&quot;#四因果-mask-和变长序列&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、它优化的是 IO，不是把复杂度变成线性&quot;,&quot;url&quot;:&quot;#五它优化的是-io不是把复杂度变成线性&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、为什么实际速度可能没有论文那么快&quot;,&quot;url&quot;:&quot;#六为什么实际速度可能没有论文那么快&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、使用时先确认版本和回退路径&quot;,&quot;url&quot;:&quot;#七使用时先确认版本和回退路径&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、和量化、KV Cache 一起看&quot;,&quot;url&quot;:&quot;#八和量化kv-cache-一起看&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、从工程角度如何判断值得使用&quot;,&quot;url&quot;:&quot;#九从工程角度如何判断值得使用&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;总结：性能优化常常是少搬数据&quot;,&quot;url&quot;:&quot;#总结性能优化常常是少搬数据&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 09 Nov 2025 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>FlashAttention</category><category>GPU</category><category>性能优化</category>
  </item>

  <item>
    <guid>https://www.hansking.cn/blog/2026/KVCacheLLM-tui-li-wei-shen-me-hui-bei-xian-cun-ka-zhu</guid>
    <title>KV Cache：LLM 推理为什么会被显存卡住</title>
    <link>https://www.hansking.cn/blog/2026/KVCacheLLM-tui-li-wei-shen-me-hui-bei-xian-cun-ka-zhu</link>
    <description>[{&quot;value&quot;:&quot;KV Cache：LLM 推理为什么会被显存卡住&quot;,&quot;url&quot;:&quot;#kv-cachellm-推理为什么会被显存卡住&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、先理解自回归生成&quot;,&quot;url&quot;:&quot;#一先理解自回归生成&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、KV Cache 为什么会占很多显存&quot;,&quot;url&quot;:&quot;#二kv-cache-为什么会占很多显存&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、Prefill 和 Decode 对 Cache 的使用不同&quot;,&quot;url&quot;:&quot;#三prefill-和-decode-对-cache-的使用不同&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、为什么连续批处理需要更聪明的 Cache&quot;,&quot;url&quot;:&quot;#四为什么连续批处理需要更聪明的-cache&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、前缀缓存可以复用，但必须确认边界&quot;,&quot;url&quot;:&quot;#五前缀缓存可以复用但必须确认边界&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、Cache 量化和压缩要用质量换算&quot;,&quot;url&quot;:&quot;#六cache-量化和压缩要用质量换算&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、Cache 管理要考虑取消、抢占和恢复&quot;,&quot;url&quot;:&quot;#七cache-管理要考虑取消抢占和恢复&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、上下文窗口不是无限记忆&quot;,&quot;url&quot;:&quot;#八上下文窗口不是无限记忆&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、如何压测 KV Cache&quot;,&quot;url&quot;:&quot;#九如何压测-kv-cache&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;总结：缓存是速度和空间的交换&quot;,&quot;url&quot;:&quot;#总结缓存是速度和空间的交换&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 28 Sep 2025 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>KV Cache</category><category>GPU</category><category>推理优化</category>
  </item>

    </channel>
  </rss>
