面
ohmyinterview
搜索
首页
博客
工具箱
文档
书房
影院
游戏
成语
参数
菜谱
汉字
热榜
#推理优化
人工智能
困难
LLM 服务的延迟指标 TTFT 和 TPOT 分别受什么影响?如何针对性优化?
2026-08-15
人工智能
中等
Prompt caching(前缀缓存)的原理是什么?如何组织 prompt 才能命中缓存?
2026-08-15
人工智能
困难
大模型量化(INT8/INT4、GPTQ、AWQ、GGUF)是怎么回事?精度损失如何评估?
2026-08-14
人工智能
困难
LLM 推理中的 KV cache 是什么?它如何决定服务的并发能力?
2026-08-14
人工智能
困难
投机采样(speculative decoding)为什么能在不损失质量的前提下加速解码?
2026-08-14
人工智能
中等
MHA、MQA 与 GQA 有什么区别?为什么推理时它们很重要?
2026-08-11
人工智能
中等
KV Cache 是什么,它如何加速大模型推理?
2026-07-31