模型边生成边返回 Token,用户无需等待完整回答。
流式输出通过 SSE 等协议逐 Token 推送,让首 Token 在几百毫秒内到达,显著改善对话体验,也是多数 API 的默认能力。计费仍按完整输出 Token 计算。