Capabilities · AI 能力底座

让 AI 走进流程
决策有据可依

六大能力构成底座:模型怎么接、知识怎么建、智能体怎么编排、数据怎么问、权限怎么管、集群怎么部署。 这一页把选型和做法都摊开讲 —— 包括我们为什么在某些环节故意选了更笨但更稳的方案

Recall
0
混合检索 + 重排
知识召回率
Latency
<0 s
端到端
问数响应
On-Prem
0
可私有化
数据不出园区
Six Pillars · 六大能力

底座是六块拼起来的

每块下面的进度条是我们在已交付项目里的实测覆盖率 / 准确率,不是宣传口径的满分。

CORE

大模型统一接入

全面兼容国内外主流商业、开源及私有化大模型,统一进行 Token 调度、网关路由、请求计费与日志监控。换模型只改配置,不改业务代码。

DeepSeek Qwen2.5 私有 LLM
模型适配覆盖95%
RAG

RAG 知识工程

支持合同大纲、结构化表格与扫描件的高精切片。检索结果必须带出处,答不上来时明确说「资料里没有」,而不是编一个像样的答案。

BGE-M3 Milvus 混合检索
检索精准率92%
AGENT

AI 智能体编排

图形化拖拽把复杂任务拆成子智能体链式协作,每一步的输入输出都可回放。任务失败会落到人工队列,不会静默丢单。

LangGraph Tool Call ReAct
任务一次完成率89%
BI+AI

AI 数据驾驶舱

语音或文本问数,自动选图表、自动归因。生成的 SQL 会展示出来 —— 财务口径的事,得让懂业务的人能核对。

Text2SQL ECharts 语音问数
问数响应速度< 2s
SEC

安全与合规

权限细粒度到字段级,内容过滤沙箱拦截越界请求。谁在什么时间让 AI 做了什么、AI 引用了哪几份文件,全部留痕可查。

RBAC 等保三级 国密算法
操作留痕覆盖率100%
私有化

私有化本地集群

在政企内网完成离线部署,含模型权重、向量库与日志。附带运维手册、培训视频与完整源码,你的团队随时能接手。

K8s 集群 国产化适配 离线部署
已交付项目部署成功率100%
Retrieval · 检索策略

为什么多花一次重排的钱

很多 RAG 方案止步于「向量检索 Top-K」,看着能跑,一到专业领域就答非所问。 我们默认走两阶段:先向量召回 50 条,再用 reranker 精排出 5 条。多一次推理开销,换来的是下面这组差距。

三种检索策略在同一份电网规程语料上的表现
测试集 240 条真实业务提问 · 数值越高越好(%)
纯向量 Top-5 混合检索 + 重排
代价是每次问答多约 120ms 与一次 reranker 推理。对「答错要担责」的场景,这个成本非常划算。
01

切片:按语义而不是按字数

规程条款、合同条目、表格行都是有边界的。按固定 512 字硬切会把一条规定劈成两半,检索出来只剩半句话。

02

召回:向量 + 关键词双路

纯向量对「GB/T 50065」这类编号型查询几乎无效,得靠关键词兜住;纯关键词又答不了「类似情况怎么处理」。两路都要。

03

精排:把选择权交给 reranker

召回阶段宁滥勿缺(Top-50),由 bge-reranker-v2-m3 逐条判断相关性再取 5 条进上下文。噪声进得少,幻觉自然少。

Stack · 技术选型

用什么,以及为什么

选型不是列时髦名词。下面每一行都标了「为什么选它」,也标了它不适合什么场景。

大模型

  • DeepSeek-V3 / R1 主力推理

    中文理解与长文档摘要表现稳,蒸馏版能塞进单机双卡跑私有化。

  • Qwen2.5 系列 结构化输出

    函数调用与 JSON 输出稳定度好,Agent 编排里当执行层。

  • Qwen2-VL 多模态

    读扫描件、水位尺照片、工程图纸标注。识别结果一律标注置信度。

  • Ollama / vLLM 承载

    小规模内网用 Ollama 省事;并发上来换 vLLM,吞吐差好几倍。

检索与知识

  • BGE-M3 向量化

    中英混排与长文本都能吃,同时产出稠密 + 稀疏向量,一个模型顶两路。

  • bge-reranker-v2-m3 精排

    Top-50 召回后逐条打分。上一节那组差距主要就来自这一步。

  • Milvus 向量库

    千万级向量仍能稳住 P95。百万级以下我们会直接用 PostgreSQL + pgvector,省一套中间件的运维。

  • MinIO 对象存储

    原始文件留档,答案引用时能直接跳回原文件的对应页。

编排与应用

  • LangGraph 工作流

    有状态图而不是线性链,失败能从断点重跑,不必整条重来。

  • Spring Boot 3 / SpringCloud 后端

    国企 IT 团队最熟的一套,交接后他们能自己改,这比技术先进性更重要。

  • Vue 3 / React 18 前端

    按客户既有栈选,不强推。已有前端团队的项目一律跟随对方技术栈。

  • CesiumJS / PostGIS 水利专用

    三维孪生与淹没演推;空间查询下沉到 PostGIS,前端只负责渲染。

部署与运维

  • Docker Compose 中小规模

    单机或三台机器的场景不上 K8s。少一层抽象,客户运维能自己看懂。

  • Kubernetes 集群规模

    多节点、需要弹性扩缩容或已有国资云平台时才用。

  • Prometheus + Grafana 监控

    质量闸门的那几个指标就挂在这里,阈值告警直达值班群。

  • 离线镜像包 内网必备

    物理隔离环境没有公网。所有依赖打成离线包带进现场,含模型权重。

Localization · 信创国产化

从芯片到大模型,全栈可替换

国资 / 央企项目基本都会问这一条。下面是我们实际验证过的组合, 带「已验证」标记的是在真实项目里跑过的,其余是可支持但尚无落地案例,不含糊其辞。

国产芯片
  • 鲲鹏 920已验证
  • 海光 CPU已验证
  • 昇腾 910 推理卡可支持
信创操作系统
  • 统信 UOS已验证
  • 银河麒麟 V10已验证
  • 欧拉 openEuler可支持
国产数据库
  • 达梦 DM8已验证
  • 人大金仓 KingbaseES已验证
  • OceanBase可支持
国产大模型
  • DeepSeek 系列已验证
  • 通义千问 Qwen已验证
  • 智谱 GLM / 百川可支持
一个要提前讲清的现实:国产芯片上跑大模型,推理速度目前仍低于同代 NVIDIA 方案。 我们的做法是把模型规模与并发预期在方案阶段就算清楚,必要时改用「小模型 + 强检索」的组合, 而不是等上线后才发现响应慢。
Security · 安全与边界

AI 能碰什么,是我们一开始就划死的

「AI 出错谁负责」是政企客户第一个会问的问题。答案不在免责条款里,在架构里。

人在回路,且是最后一环

AI 只产出草稿:报告草稿、回复草稿、风险标注。真正发出去、真正生效的那一步, 必须由有权限的人点击确认。出错停留在草稿层,碰不到真实业务。

全链路留痕,可倒查

谁在什么时间提了什么问、AI 检索了哪几份文件、引用了哪几段、最终谁批准的 —— 全部落库。审计时能一路倒查到原始文件的具体页码。

数据不出园区

系统、模型权重、向量库、日志全部本地存储,物理隔离环境不留任何外呼通道。 支持国密算法与等保三级,可签署数据安全责任书。

等保三级 国密 SM2/SM4 字段级 RBAC 内容过滤沙箱 操作审计日志
看合规相关问答