做视频的老板,常在服务器上栽的跟头,不是配置买低了,是买错方向。我见过一个做在线教育的,租了台32核的高配机器,跑直播照样卡。后来一看,他压根没开转码,CPU空着,瓶颈在带宽和线路上。视频业务和普通网站完全是两种活法,照着服务器租用那套web思路配,钱花了不办事。视频服务器和普通服务器,差在哪 普通网站服务器主要扛并发请求和数据库读写,CPU闲着也能跑。视频服务器两件事实打实吃资源:一是转码...
在线客服系统对大模型的要求很矛盾:既要答得准,又要响应快,还要账单可控。单一模型很难同时满足。API 中转层在这中间做智能调度,把不同问题分给合适的模型,而不是让客服系统自己写一堆路由代码。 调度器先给每个模型打标签。擅长长文理解、按步骤执行的标一类,响应快但能力浅的标一类,成本低的轻量款再标一类。客服系统来一个请求,中转层看意图分类和实时负载,决定走哪条。moxing.tuidc.com...
一家做企业知识库的公司,RAG 系统上线半年后卡在一个点上:最初用一家大模型做生成,后来发现长文档问答容易漏章节,想换一家擅长长文本的,但生成层和那家的接口、返回格式绑得太死,光是改调用就动了半个月。如果当初生成层走的是统一中转,换模型只改个配置,这事两天就能解决。 RAG 天生是"多模型"结构。检索阶段要 embedding 模型把问题和文档切成向量,生成阶段要大模型把检索到的片段组织成答...
做直播的老板常踩一个坑:拿普通网站的带宽经验套直播,按"日均访问量"去估带宽,结果开播没几分钟就卡成幻灯片。直播和网站根本不是一回事,带宽算法差着数量级。直播带宽看架构,不看见人头网站是"请求-响应",一个人打开页面拉一次就完了。直播是"持续推流",只要观众在线,就一直占着带宽。这里有个很多人不知道的点:如果你把直播流推到 CDN,源站服务器只要往外推一路流,带宽就是单个码率的几 Mbp...
8月20日,“智启河南·AI向新——企业智能办公技术交流会”在郑州市中原科技城人工智能科技园成功举办。本次活动由中原科技城管理委员会、河南省人工智能协会主办,郑州中原科技城科创联盟、百度智能云、郑州腾佑科技有限公司(百度智能云河南服务中心)承办,河南省新的社会阶层人士联谊会、河南省好睦邻商业管理有限公司、中原科技城人工智能科技园、河南广播电视台《数字河南》栏目、河南玄同智能科技有限公司协办。省委统...
让你们对大带宽的需求与日增多,100M、500M、1G——大带宽的规格梯度越来越细。选小了高峰期卡死,选大了每个月白交一堆带宽费。关键是搞清楚你的业务到底需要多大带宽,以及除了带宽数字之外还有什么指标要关注。选规格不能只看并发人数。同样的1000人在线,看图文网页和看高清直播消耗的带宽差几十倍。下面按业务场景拆开说。四种典型场景的带宽需求业务场景核心带宽需求建议规格起点关键注意事项视频直...
同样签了100M独享带宽,一家公司用了一年没断过网,另一家三个月断了四次,找机房索赔,机房说合同里写的是"尽力而为",不赔。两家付的钱差不多,体验差了十万八千里。差别在哪?在合同条款里。大带宽租用的合同不是走过场,SLA条款、赔付条件、计费方式,每一行都直接关系到你的业务能不能扛住突发状况。今天就当一回合同审查员,把该看的条款逐条拆开。SLA可用性承诺:99.9%和99.99%差的不只是数字</h...
2核4G、4核8G、8核16G——云厂商的配置页面上一堆选项,价格从几十块到几千块都有。很多客户的第一反应是选个中间档,够用就行。问题是,什么叫够用?配置选小了,业务一上量就卡死;选大了,每个月白花不少钱。今天就按业务类型把配置搭配讲清楚,不绕弯子,直接给你参照方案。CPU选几核:看并发,不看感觉CPU核心数取决于你的业务并发量,不是感觉差不多就行。一个简单的判断方法:同时在线用户数除以...
上周有个客户问我,他们要做AI推理,预算有限,能不能用消费级显卡凑合一下。我说你先别急,咱们看看你的模型有多大、批量推理还是实时推理、用什么框架。显卡选型这事,不是只看显存够不够,算力架构、驱动支持、功耗墙,每个都可能卡住你。GPU服务器租用的显卡选型,我见过太多拍脑袋决定的案例了。选贵了浪费钱,选便宜了跑不动,最坑的是选了看似性价比高的,结果框架不支持。今天就按场景把主流显卡捋一遍。AI训练:显...