企业系统接入大模型 API:先把这几笔账算清楚
2026-10-09
6
客户来问 AI 客服,我一般会先问一个问题:你说的 AI 客服,是让它答你产品的常见问题,还是想让它像销售一样跟客户聊? 十次里有七次,对方会愣一下,说 "这个我们还没想过"。 这个回答我太熟了。找我们做 AI 功能的客户,开口都是 "我们要做个 AI 客服",问下去,有人想给售后减负,有人想把销售话术统一,还有人纯粹是看同行上线了 AI,自己不能没有。需求完全不一样,方案、预算、工期,差得不是一点半点。 这篇不打算讲概念,概念网上到处都是。我写点实在的:接大模型 API 这事,钱花在哪、坑在哪、哪些事别一开始就想岔了。先泼一盆冷水:别急着训模型 先说结论,可能有点得罪人:绝大多数企业做 AI 功能,不需要训练模型,连微调都未必用得上。 现在通用大模型 API 开箱就能干的活不少,答客服、写文案、做资料问答、抽结构化信息,都行。真到需要自己动模型的程度,基本绕不开三件事:数据出不了内网、响应要极低延迟、业务知识非常垂直而且 API 怎么调都不准。 举政企项目说,数据不出域是硬要求,那就只能私有化部署。这跟买 API key 完全是两个量级:GPU、运维、模型版本管理全得自己扛,成本至少翻几倍。反过来,只是给内部员工做个知识库问答,数据不敏感,直接调 API 就是最划算的。 所以我们谈需求,顺序是反的:先问数据能不能出去、业务允不允许用公有云,再谈选哪个模型。这两个问题没有答案,后面聊的全是白聊。接 API 最容易翻车的地方 模型选型其实最省事,各家接口基本都兼容 OpenAI 那套格式,换模型就是改个参数。真正耗时间的是工程。下面四个坑,是我们被坑得比较多的。 超时和重试,代码必须写对。大模型生成是流式的,慢的时候几十秒都正常,网络层默认超时根本不够用;反过来完全不设超时,服务一挂,请求全堆在那儿,把别的接口也拖死。我们最早就是吃了这个亏,才沉淀出下面这个模板:import timeimport requestsdef call_llm(prompt, model="qwen-plus", max_retries=3): url = "//api.example.com/v1/chat/completions" payload = { "model": model, "messages": [