千问流式SSE输出与前端打字机效果实现
本文深入解析了如何通过自建代理将千问API改造为SSE流式接口,并在前端实现逼真的打字机效果:后端需严格遵循SSE协议,设置正确响应头、分块发送带data:前缀的文本并禁用缓冲;前端既可用EventSource(简洁但限于GET和凭据配置)监听增量数据,也可用fetch+ReadableStream实现更灵活的POST请求与精细流控;关键在于将接收到的文本块拆解为字符或语义单元,结合requestAnimationFrame平滑逐字渲染,同时妥善处理连接中断、页面卸载、服务端结束信号(如[DONE])等边界情况,确保体验流畅、状态可控、资源干净——让AI回复真正“活”起来。

如果您在使用千问的API时希望实现流式SSE(Server-Sent Events)输出,并在前端呈现打字机效果,则需后端按SSE协议逐块推送文本片段,前端通过EventSource监听并增量渲染。以下是具体实现方式:
一、后端启用SSE响应格式
千问API本身不原生暴露SSE接口,需通过自建代理服务将标准HTTP请求转换为SSE流式响应。服务需设置正确响应头,持续写入以data:开头、以\n\n分隔的事件块,并保持连接不关闭,直到响应完成。
1、配置HTTP响应头:Content-Type设为text/event-stream;Cache-Control设为no-cache;Connection设为keep-alive。
2、构造SSE数据块:每段文本前添加data:前缀,末尾追加两个换行符\n\n,例如data:你好\n\n。
3、禁用响应体缓冲:在Node.js中调用res.flush()或设置res.socket.setNoDelay(true);在Python Flask中使用yield配合response.stream并禁用wsgi.server软件缓冲。
二、前端建立EventSource连接
浏览器通过EventSource API建立长连接,自动重连并解析SSE数据流。该方式仅支持GET请求,且无法携带认证凭据(如Cookie或Authorization头)除非显式配置withCredentials。
1、创建EventSource实例:const es = new EventSource('/api/chat-stream', { withCredentials: true });
2、监听message事件:es.addEventListener('message', event => { const chunk = event.data; appendToDisplay(chunk); });
3、处理连接错误:监听error事件,检查es.readyState值,0表示未连接,1表示正在连接,2表示已连接;若长时间为0或1,可手动调用es.close()后重建。
三、前端实现逐字打字机渲染
接收到的每个data块可能包含多个字符甚至整句,需将其拆解为单字符或按语义单位(如中文词、标点)逐步插入DOM,配合setTimeout或requestAnimationFrame控制节奏,避免阻塞主线程。
1、获取当前显示容器元素:const outputEl = document.getElementById('output');
2、定义打字函数:function typeText(text, index = 0) { if (index typeText(text, index + 1)); } }
3、在message回调中调用:event.data非空时,执行typeText(event.data),注意需维护全局累计文本变量以避免重复追加。
四、使用fetch+ReadableStream替代EventSource
当需要POST请求、自定义headers或更精细流控时,可用fetch配合Response.body.getReader()读取流式响应。此方式绕过SSE协议解析,直接处理原始字节流,兼容性要求Chrome 68+/Firefox 65+。
1、发起fetch请求:fetch('/api/chat-stream', { method: 'POST', headers: { 'Content-Type': 'application/json' }, body: JSON.stringify({ prompt: '你好' }) })
2、获取Reader并循环读取:const reader = response.body.getReader(); async function read() { const { done, value } = await reader.read(); if (done) return; const decoder = new TextDecoder('utf-8'); const chunk = decoder.decode(value); appendChunkAsTyping(chunk); await read(); }
3、处理粘包与分块:服务端应确保每个write()调用对应一个语义完整片段,前端需缓存未闭合的UTF-8多字节序列,避免解码乱码。
五、处理中断与状态同步
流式传输过程中用户可能取消请求、切换页面或网络中断,前端需主动清理资源并还原UI状态,防止残留loading态或错乱文本。
1、绑定页面卸载监听:window.addEventListener('beforeunload', () => { if (es) es.close(); if (abortController) abortController.abort(); });
2、点击停止按钮时:调用es.close()或abortController.abort(),同时清空outputEl内容并置灰操作按钮。
3、检测服务端结束信号:约定服务端最后发送data:[DONE]\n\n,前端监听到该字符串后执行收尾逻辑,不可依赖event.data为空判断流结束。
今天带大家了解了的相关知识,希望对你有所帮助;关于科技周边的技术知识我们会一点点深入介绍,欢迎大家关注golang学习网公众号,一起学习编程~
HTML中ArrayBuffer二进制操作详解
- 上一篇
- HTML中ArrayBuffer二进制操作详解
- 下一篇
- 2024最火AI工具:Recraft矢量超越指南
-
- 科技周边 · 人工智能 | 23小时前 |
- vLLM 连续批处理下的显存与吞吐取舍
- 209浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- Reranker 接入后如何控制检索延迟预算
- 113浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- Embedding 向量维度变化时的索引迁移方案
- 429浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- Agent 轨迹评测区分工具错误与模型错误
- 239浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- MCP 资源与工具描述的缓存更新策略
- 313浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- MCP 服务端授权范围与会话隔离的配置
- 161浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- MCP 工具结果分页与长列表截断的设计
- 486浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 | 人工智能 · chat template apply_chat_template AI tokenizer 多模型消息格式
- AI tokenizer chat template 统一多模型消息格式
- 154浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 424次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 502次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 511次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 459次使用
-
- MMBench
- MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
- 288次使用
-
- 本地大模型反复输出同一句话怎么调整生成参数
- 2026-09-06 501浏览
-
- Python 调用大模型时如何用结构化输出校验 JSON:从解析失败到可重试
- 2026-08-29 501浏览
-
- AI写作工具免费版安装教程(含豆包Clawdbot)
- 2026-05-30 501浏览
-
- WPS AI能自动生成PPT吗?输入主题一键制作演示文稿
- 2026-05-27 501浏览
-
- Canva手机闪退解决方法及适配指南
- 2026-05-25 501浏览

