avatar

Neo·元

算法的尽头,认知的倒影

  • 首页
  • 三千问道
  • 万法归宗
  • 诗酒田园
  • 关于NeoBlog
主页 Token 暴涨、上下文爆炸的 5 种真实业务优化
文章

Token 暴涨、上下文爆炸的 5 种真实业务优化

发表于 12天前 更新于 12天前
作者 Neo
1~1 分钟 阅读

做大模型应用,最容易被忽视但最致命的问题就是 Token 爆炸。很多项目原型跑得很好,一上线就崩,不是模型不行,而是上下文直接撑爆。

固定做 5 件事,基本能把 Token 压到原来的 1/3 甚至更少。

第一,历史对话必须截断。没有人需要无限长的上下文,保留最近 5~10 轮足够。

第二,系统提示词精简。很多人写几百字的提示词,其实真正有用的就两三句。我现在一般控制在 50 字以内。

第三,长文档不直接塞模型。用向量检索,只取最相关的两三段,既省 Token 又提高准确度。

第四,历史对话做摘要。旧的消息不保留原文,只保留摘要,能再砍掉一半。

第五,限制输出长度。模型一旦说废话,不仅慢,还贵,还容易超出限制。

这些优化都不需要改模型、不需要训练、不需要高深技术,直接上线就能见效。

我在多个私有化项目里验证过,优化前和优化后完全是两个世界。速度快、成本低、服务稳、不易崩。

很多开发者觉得优化 Token 是小事,等真正线上炸了才知道,这是决定项目能不能落地的关键。

万法归宗
许可协议:  CC BY 4.0
分享

相关文章

8月 11, 2026

浅谈LangChain\LangGraph(下)

前言: 之前已经在本地跑通了LangChain的Demo项目了,接下来要改造成LangGraph,首先分析一下langGraph的几大优势点: 我的个人总结: 1、从线性管道到状态机节点(类似从二维升级到了三维,单线程变成多线程) 2、控制流变成循环、分支,比原先的单向高级了 3、容错性变强、支持回

8月 10, 2026

浅谈LangChain\LangGraph(上)

前言: 简单聊一下使用LangChain的一些心得,个人感觉就是操作大模型调用自己的向量数据库,然后触发自定义工具包的一个生产框架,主要包括RAG(向量数据库)和Agent(工具包)两部分核心组成。 RAG一般来源于企业生产中的文档资料,需要转换成大模型识别的向量数据库,一般要先把Word\Exce

7月 31, 2026

中小企业私有化大模型硬件配置实战

站在中小企业的视角,自研私有化大模型的核心诉求从来不是极致高并发、超大参数量模型集群,而是低成本采购、单人可运维、稳定支撑日常业务问答、文档摘要、内部知识库检索这类轻量化场景。 市面上很多算力教程都是面向互联网大厂、AI 实验室撰写,动辄多卡分布式、A100/H100 专业算力卡,完全脱离中小团队的

下一篇

FastAPI + AioRedis 消除线程阻塞实战

上一篇

中小企业私有化大模型硬件配置实战

最近更新

  • 浅谈LangChain\LangGraph(下)
  • 浅谈LangChain\LangGraph(上)
  • 中小企业私有化大模型硬件配置实战
  • Token 暴涨、上下文爆炸的 5 种真实业务优化
  • FastAPI + AioRedis 消除线程阻塞实战

热门标签

AI

©2026 All Rights Reserved Neo 鲁ICP备2026037083号