FEATURED · 精选文章

AI基础设施转型:从服务器交付到可运营底座的关键能力

发布时间 / 2026/8/30 4:04:05
来源 / 创域科博编辑部
栏目 / 资讯中心
AI基础设施转型:从服务器交付到可运营底座的关键能力 过去一两年我身边越来越多做企业数字化的朋友开始意识到一个尴尬大模型选型其实没那么难真正难的是找到一台能长期稳定运行模型、并且“养得起”的服务器。很多项目在云端 POC 阶段跑得很流畅一到私有化部署就陷入环境适配、驱动冲突、显存不足、存储延迟等各种问题。也正因为这样看到“联想不断向AI基础设施公司靠拢”这个趋势时我反而觉得比它发布多少款新品更值得认真拆解。这件事真正有意思的地方在于联想不是在给服务器换一个营销说法而是在把过去“卖产品”的生意模型改造成“交付可运营底座”的模型。它能不能转型成功取决于对“基础设施”这个词的理解到底有多深。1. 为什么“卖电脑”的联想会越来越像一个基础设施公司1.1 从交付产品到交付能力联想过去的核心生意本质上都是围绕“盒子”展开的。PC 是盒子服务器是盒子存储设备也是盒子。企业采购这些设备重点关注的是参数、价格、稳定性和售后服务。一台服务器交付到客户机房签完验收单这笔交易在很大程度上就完成了。但 AI 时代的采购逻辑变了。客户不再只是买一台 GPU 服务器而是想得到一个“能承载大模型推理、微调、数据流转和应用部署”的能力底座。这听起来很像概念包装实际上却反映了一个真实变化本地化部署、私有化部署、智算中心建设的需求越来越多客户要的不只是硬件而是“开箱即用”的 AI 环境。于是硬件厂商的工作从“交付一台机器”变成了“交付一套可运行的系统”。它要预先装好驱动、推理框架、模型仓库、监控工具甚至要处理客户业务数据与模型服务之间的连接。联想向 AI 基础设施公司靠拢本质上是在顺应这个变化把服务器、存储、网络、终端重新组合成“AI 基座”的形态。不过也要说清楚这件事并不容易。过去硬件厂商卖完设备就能离场现在却要在客户的机房里“陪跑”几个月甚至几年。交付能力意味着交付完只是开始。1.2 AI基础设施不是一个词而是一组能力要理解联想为什么非转型不可得先把“AI 基础设施”这个概念拆开。它不是简单的“GPU 服务器 存储”而是多层能力的组合。从工程视角看AI 基础设施至少包括四层物理层GPU 服务器、存储阵列、交换机、液冷系统等解决的计算、容量和互联问题。平台层容器、虚拟化、GPU 调度、模型仓库、镜像服务解决资源分配和开发环境问题。模型层推理服务、微调环境、向量数据库解决模型“怎么用起来”的问题。运维层监控、日志、告警、版本管理、安全审计解决“怎么持续稳定运行”的问题。前两层偏向传统 IT 能力联想有多年积累。真正麻烦的是后两层它们本质上是软件和生态能力。很多传统硬件厂商的尴尬就在这里能出货高端 GPU 服务器却拿不出一套足够好用的推理服务和管理工具。客户买回去还是要自己组团队、写脚本、搭环境硬件厂商的价值就被压缩了一大半。所以联想强调自己是“AI 基础设施公司”不能只停留在口号上。它必须证明自己在平台层、模型层和运维层也有能力而不能只把硬件重新包装一下。否则客户依然会把它当作“卖机器的”。1.3 “AI基础设施”为什么是联想必须押注的方向从行业演进来看基础设施化是每个技术浪潮走到一定阶段的必然结果。早期互联网时代企业要自建机房、自己维护网络和存储后来云服务把这套能力标准化了。AI 时代也一样模型能力越来越强但企业不可能每个人都成为机器学习工程师他们更需要一套“AI 基础设施”把模型部署、调用、运维的复杂度给屏蔽掉。联想必须押注这个方向原因有三第一传统硬件市场已经高度同质化。只靠服务器、PC 的销量增长很难撑起公司的长期想象空间。而 AI 基础设施是增量市场。第二联想有硬件和渠道的存量优势。它服务过大量政企客户有维修、售后、供应链和渠道网络这是很多新兴 AI 公司短时间内难以复制的。第三AI 基础设施赛道还没有形成一家独大的格局。虽然云厂商在公有云上很强但私有化部署、行业解决方案、边缘场景仍然存在大量机会传统 IT 厂商有机会分到一杯羹。但这并不等于胜券在握。恰恰相反联想要面对的最大风险是用户会拿它和云厂商、和更纯粹的 AI Infra 公司对比。对比的不只是硬件性能还有软件体验、社区生态、开发者友好度。2. AI基础设施的关键不再是“算力”而是“可运维性”2.1 本地部署AI环境一致性比模型本身更磨人很多人以为本地部署一个开源大模型就是下载权重、写段代码、跑起来。真正做过一遍的人都知道模型权重反而是最好搞定的部分绝大多数时间会被环境问题消耗掉。我在实际测试里遇到过这些情况NVIDIA 驱动和 CUDA 版本不兼容Python 包依赖冲突容器里能跑但宿主机跑不了GPU 显存被其他进程占用导致推理进程直接 OOM模型从仓库下载到本地后 SHA256 不匹配。这些问题都不是模型能力问题而是环境一致性问题。所以本地部署 AI 时我建议按这样的顺序排查先看现象是进程起不来还是推理时崩掉还是结果异常。再看输入确认模型文件路径、格式、Prompt 上下文是否正常。再看环境确认驱动、CUDA、PyTorch/TensorRT 等版本是否和模型要求一致。再看资源用nvidia-smi看显存和 GPU 利用率确认有没有进程占用。最后看参数并发数、批次大小、量化精度是否超出硬件能力。一个很典型的例子是很多人把服务器端调试好的配置原封不动搬到另一台机器上结果模型推理速度“像蜗牛”。一查才发现新机器的 GPU 驱动太老程序根本没调用 GPU而是 CPU 在硬扛。这也是 AI 基础设施公司的价值所在如果能提供标准镜像、一键部署、环境检测工具把“环境一致性”这种脏活累活消化掉客户体验会完全不同。2.2 AI Agent和应用开发正在倒逼基础设施升级如果说单模型部署已经够复杂那么 AI Agent 的兴起会让基础设施复杂度再上一个台阶。Agent 和传统单次推理最大的区别在于它需要“自主行动”。它要调用工具、维护长期记忆、组合多个模型的结果、处理多轮会话的上下文。这意味着基础设施不能只解决“一次推理”的问题还要支撑如下能力大量 API 调用和工具调用请求是成组出现的持久化存储包括会话记录、向量数据库、工具执行结果并发调度多个 Agent 同时运行时需要队列、资源隔离和优先级审计与安全Agent 在调用外部工具时要记录日志、校验权限、追踪行为。从应用开发者的角度看这些好像属于业务层的问题。可一旦落到基础设施层它们立刻变成存储扩容、网络带宽、GPU 并发、消息队列和容器调度的配置问题。很多开发团队刚开始做 Agent 时只关注提示词做到后来才发现最大的瓶颈不是模型不会回应而是底层基础设施撑不住并发和状态管理。这也是为什么像联想这样的基础设施厂商会越来越关注 AI Agent 相关方案。Agent 是应用和基础设施之间的一个映射点。谁能让 Agent 在这些硬件资源上稳定、可控、可追踪地运行谁提供的底座就更有粘性。2.3 从部署到运维基础设施的价值在生命周期我见过一个团队费了很大力气把模型部署到生产环境然后就把精力全放回业务。结果过了一周模型推理越来越慢甚至偶尔无响应。最后排查发现日志文件写满了磁盘缓存也没有清理某个依赖服务把内存吃完了。这类问题说明AI 基础设施的核心考验不在“部署成功的那一刻”而在后续的日常运维。一个可用的基础设施至少要能回答这些日常问题GPU 资源使用趋势如何什么时候需要扩容节点模型版本更新后如何平滑切换、如何回滚请求量增长时队列和调度策略能否自动调整故障发生时日志链路是否足以定位到具体服务如果企业自己维护这些都需要专门的 SRE 或运维能力。如果基础设施厂商提供就要把监控面板、告警规则、日志采集、模型版本管理都做成标准能力。否则客户买到的只是“基础设施”而不是“可用的基础设施”。这个区别是衡量联想这类转型能否成功的试金石。3. 中小企业落地AI基础设施的四个正确姿势3.1 先用业务场景反推需求而不是先买硬件我跟不少技术负责人聊的时候发现大家有一个共同冲动看到新模型发布就想着买服务器、搭平台。但一落到真实业务第一个问题往往不是“用什么卡”而是“这个场景需要多强的推理能力”。比如如果做的是内部知识库问答关键通常不是海量 GPU而是文档解析质量、向量检索效果和存储 IO。如果做的是面向用户的实时对话应用那就要关注并发、响应延迟和稳定性。如果想做模型微调那训练资源和大规模数据管护才是主要成本。所以更稳妥的顺序是先列出业务场景、并发量、响应时间、数据安全和预算边界再反推需要什么样的基础设施。场景没有定义清楚之前再贵的服务器都有可能长期闲置。这里可以做一个粗略的映射业务场景主要瓶颈基础设施关注点内部知识库问答检索质量、上下文拼接向量数据库、存储IO、CPU/内存实时对话应用响应延迟和并发GPU推理加速、负载均衡、监控模型微调/训练训练吞吐和数据管理GPU集群、高速网络、数据管理边缘端AI识别功耗和网络环境边缘设备、模型压缩、端侧推理3.2 从最小闭环开始不要一步到位另一个常见问题是“一步到位”。很多项目一上来就规划三机八卡集群觉得这样才够冗余、够性能。但实际上如果业务还在验证阶段我更建议先用最少资源跑通一个最小闭环一台带单张 GPU 的开发机或者直接使用云端的 GPU 实例。把数据准备、模型推理、前后端联调跑通记录每个环节的资源占用和响应时间再评估下一步。这样有两个好处一是投入风险小。验证期不需要一次性花一大笔钱买设备。二是采购参数会更清晰。等业务稳定了你会有第一手的数据说清楚需要多少 GPU、多少内存、多少存储。我甚至建议小团队一开始不要搭太复杂的集群哪怕只是在一个 24GB 显存的消费级 GPU 上跑一个小模型先把推理接口、日志、监控流程走通。很多人以为“用大模型一定要用大参数模型、大显存”但实践中量化到 7B 或 13B 的模型在很多业务场景里已经够用。基础设施的规模应该跟着实际指标走。3.3 算清长期成本云和本地各有边界AI 基础设施的投入不只是买机器那一笔钱。后面还有电费、机柜、运维人力、模型迭代训练、存储增长每项都在持续产生成本。我见过一个团队为了“省钱”选择私有化部署结果半年后运维同学离职系统没人能维护。最后整体成本比用云服务高得多。所以在私有化和云服务之间做选择时至少要算这几项机房空间和电力改造费GPU 服务器峰值功耗往往在几百瓦甚至更高供电和散热要单独规划。运维人力成本一个懂 GPU、容器、模型部署的工程师年成本可能远超一台服务器本身。硬件故障和备件成本GPU 服务器一旦故障维修时间可能远比公有云恢复实例长。软件升级和技术支持费用模型、框架都在快速迭代长期维护需要持续投入。如果只是验证需求云端按需付费通常更划算。等业务稳定、使用量可预测之后再评估私有化。“先云后备”的路径对很多中小企业来说比“一步到位私有化”更稳。3.4 团队技能比硬件选型更关键很多公司买了 AI 基础设施后才发现团队里没有人能熟练部署和管理。GPU 服务器跟普通 x86 服务器并不是同一类东西它需要理解 CUDA 环境、容器调度、模型推理框架、日志监控甚至高性能网络配置。在团队技能不足的情况下我建议大家别一次性铺开大规模集群。可以先让团队用一台单机环境做练习把“模型部署—接口调用—监控日志—异常恢复”这四步跑熟练。等团队具备基本能力后再逐步引入集群调度和自动扩缩容。工具链选择上也尽量优先文档全、社区活跃、可替换性强的方案避免被某个冷门框架绑死。AI 基础设施的未来大概率会走向开放生态如果一开始就锁定私有方案后面想迁移的成本会非常高。4. 联想的机会、挑战与普通使用者的选择4.1 联想手里确实有转型的基础客观地说联想向 AI 基础设施公司转型并不是无源之水。它在服务器、存储、网络设备这些领域已经积累了很多年而且拥有庞大的企业客户渠道和线下服务网络。AI 基础设施最终要落地到物理机房要有人去装机、调试、维修这套服务能力是很多新兴玩家不具备的。更关键的是联想在硬件供应链上的能力可以帮助它做“交钥匙”方案。比如把服务器、存储、推理框架、模型仓库预装好做成一体机或标准方案客户开箱后只需要导入业务数据即可开始试用。这种产品形态对私有大模型需求旺盛但技术团队不完整的中小企业是有吸引力的。此外联想如果能把终端、服务器、云三块业务串成一条线就能做出一种前后端一致的使用体验前端 PC 或工作站处理交互后端服务器或集群处理模型推理和数据存储。这种“全链路”能力如果真能落地会别有一个竞争优势。4.2 真正的门槛在软件生态和服务模式但话说回来联想最大的挑战不是技术而是组织惯性和商业模式。AI 基础设施这个方向表面上是硬件生意实际上很大一部分价值在软件运维和生态服务上。软件和服务的毛利未必比硬件高但人力投入却大得多。这要求公司重新设计商业模式不能只靠卖盒子获得收入。另一个挑战是组织架构。传统硬件公司通常按产品线划分服务器、存储、网络、软件各自为战。而 AI 基础设施需要横向整合要有人统一对客户负责而不是让客户自己去协调多个团队。这不是技术问题是组织文化问题。还有开放生态问题。如果联想把平台做得太封闭客户会担心被锁定如果完全开放核心壁垒又会被削弱。怎么平衡标准化和定制化在不同行业里找到可复制的打法是考验管理层决心和执行力的地方。4.3 判断AI基础设施方案的五个问题不管联想最终能走多远作为普通开发者或者企业 IT 负责人在评估任何 AI 基础设施方案时都可以用下面五个问题做一次“体检”我能不能用一台普通测试机先复现你们的环境还是一定要买一整柜设备你们提供的模型服务层是只支持特定模型还是能兼容多种开源模型从部署到日常运维有没有配套的监控、日志、版本管理工具还是只给一个部署脚本让用户自己维护出了问题技术支持是否具备现场分析日志、调整调度参数的能力还是只会换硬件软件升级和模型更新是包含在服务里还是需要客户额外购买这五个问题可以帮助你过滤掉很多“伪基础设施”方案。真正的 AI 基础设施不是在 PPT 里画出多漂亮的架构图而是在真实环境里经受住“长期运行—突发流量—故障恢复”三重考验。另外不要被“AI 基础设施”这个标签迷惑。它本质上是在服务器、存储、网络、平台、模型服务之间做一套系统集成。你的数据格式、业务流程、团队技能、物理机房条件都会影响最终效果。最稳妥的方法是找一个真实的小项目小范围测试两周记录稳定性、延迟和成本再决定是否规模化引入。回到联想这个命题。它不断向 AI 基础设施公司靠拢真正值得关注的不是某一款服务器或者某一次发布会而是它是否理解AI 时代的基础设施已经从“能跑起来的机器”升级为“能持续运营的底座”。基础设施公司的终极价值不是把产品卖出去的那一刻而是用户在全生命周期里是否愿意持续依赖你。这一点对联想适用对每一个正在部署 AI 应用的团队同样适用。我们面对的是同一道题如何让技术真正长时间稳定地服务于业务。谁把这道题想得越清楚谁就能在 AI 这场长跑里走得更远。
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻