得益于kvcache,现在的大模型多倾向于 long-kvcache + short-in + long-out, 请问是否有长序列的比较维度?(面向 coding / long thinking 等新需求) For example, 1K/64K .. 目前的throughput指标被 long-in 污染较为严重,导致漂亮的统计指标与实际output体验有很大gap
得益于kvcache,现在的大模型多倾向于 long-kvcache + short-in + long-out,
请问是否有长序列的比较维度?(面向 coding / long thinking 等新需求)
For example, 1K/64K ..
目前的throughput指标被 long-in 污染较为严重,导致漂亮的统计指标与实际output体验有很大gap