PRIVATE BY DESIGN · SERVICE FIRST

把现有服务器,
变成企业自己的 AI 工作平台。

以最多 3 人同时调用 AI 为设计起点,用同一开源底座形成三种可选套餐:现有机器适配、内部 IM、企业知识库、业务集成与长期维护。

3 路同时生成,统一调度
资产复用先盘点,再决定增购
服务收费硬件、授权、服务分别列明

适用:中国大陆企业内部应用;政务项目先核准建设路径、模型与资料范围 · 金额:人民币 · 配置为待实测的选型建议,性能为验收目标,非现成跑分保证。

01 / BUSINESS THESIS

公司的产品,是可持续使用的内部 AI 能力

定位为“企业本地 AI 适配与整体交付服务商”:利用客户现有 IT 资源,建立资料可控、权限清晰、模型可换、有人维护的工作平台。

客户拥有

设备、数据与使用控制权

客户可以自行采购硬件,或由正规供应商供货;内部文档、IM 消息、索引、配置与管理权限按合同交付,支持备份、导出和迁移。

我们的服务

适配、调优、集成与维护

收取资产评估、硬件适配、模型调优、知识治理、内部软件部署、业务连接器、培训及运维费用,以交付物和验收结果体现价值。

客户购买的是:在自己的机器和网络里,员工能够稳定使用的一整套 AI 工作方式。

第一阶段把“资料查询 → 原文核对 → 内部协作 → 知识沉淀”做完整。后续按业务价值扩展制度助手、售后助手、材料整理和流程辅助。底层模型通过统一接口替换,业务应用不应随每次模型更新全部重做。

盈利来源清晰化

硬件价格、税费、保修主体透明;软件商业授权单列;服务按明确范围报价。若代采购或承担安装验机,列明相应服务费,不依赖设备信息差。

V4 保留模型研究、套餐配置、软件路线、定价、客户沟通、风险、资源、90 天计划及试点模板,新增八个律所与政府部门模拟 Case,并按推演补充政务建设路径与行业交付缺口。经营只保留报价与成本控制原则,不进行逐月现金流和固定利润推算。

02 / PACKAGE MENU / 三个标准套餐+一个专项

让客户按业务需要选套餐,不按模型参数买单

优先销售 P2 企业标准版。P1 服务预算敏感、资料较简单的客户;P3 解决复杂资料与治理需求,仍然只设计 3 路交互生成。更大的模型作为经过验证后的专项选配。

P1 / 旧机轻量版

把现有资料用起来

¥19,800 实施服务建议起价

24GB GPU+9B 量化模型;本地网页、IM 私聊助手、基础知识库、部门权限和备份。

适合制度、产品手册、FAQ。先复用已有显卡,避免为入门问答采购大机器。

查看硬件与软件 →
P2 / 企业标准版 · 主推

形成稳定的日常工作平台

¥39,800 实施服务建议起价

48GB GPU+35B MoE 量化模型;旧服务器承载应用;统一登录、资料自动同步和效果评测。

适合多部门知识查询、材料整理、带出处的跨文档回答。

查看硬件与软件 →
P3 / 知识治理增强版

让复杂资料持续可用

¥69,800 实施服务建议起价

沿用 P2 生成节点,增加解析/检索资源;文档审核、版本治理、表格处理及一个只读业务接口。

适合扫描资料较多、资料更新频繁、权限与业务流程较复杂的客户。

查看硬件与软件 →

以上是我建议你试行的服务报价,不是市场成交价或已发布产品售价。默认一般非涉密环境、指定兼容硬件、标准功能已完成产品化;硬件、第三方商业授权、差旅及年度维护另列,税费口径见定价章节。当前交付物是方案设计,文中自研模块尚未实现,不能把这些价格理解为从零开发整个平台的总包价。

首次交付范围P1 旧机轻量版P2 企业标准版P3 知识治理增强版
AI 与 IM全套餐:3 路同时生成;一个企业组织、一个网页入口、一个 IM 私聊机器人。IM 新建采用 Zulip;复用已有 IM 时须有可用接口,非标准接口另估。
账号 / 权限组初始化 30 个账号 / 3 组初始化 100 个账号 / 10 组初始化 200 个账号 / 20 组
初次资料导入500 份 / 5,000 页 / 20GB2,000 份 / 20,000 页 / 80GB10,000 份 / 100,000 页 / 200GB
扫描页与人工校验扫描占比 ≤10%;抽检 100 页扫描占比 ≤20%;抽检 200 页扫描占比 ≤30%;抽检 500 页
知识来源与更新一个批准目录;手动发布/导入两个文件来源;定时增量同步三个文件来源;增量同步、发布审核;另含一个范围固定的只读业务接口
功能定制名称/配色、2 个提示模板名称/配色、5 个模板、一个现有目录的标准 OIDC/LDAP 对接P2 基础+一个审核流程、一个结构化表格模板、一个只读业务查询场景
质量与培训150 题评测;1 场管理员培训200 题评测;2 场培训300 题评测;3 场培训及问题归因报告

份数、页数、体积以最先到达者为界;表格按约定工作表/行数折算,压缩包按解压后内容计。自动解析不等于逐页人工清洗;超出抽检的手工整理另估。账号数是初始化与验证范围,不是开源软件的授权上限,也不限制客户以后自行建账号;扩大运行规模需重新评估资源。初次入库上限不代表一天内处理完成。

P1:一台现有工作站,完成最小生产闭环

硬件清单软件落点与能力
GPU:1×RTX A5000 24GB 作为专业卡参考;已有 RTX 3090 24GB 可复用测试。新购消费卡可询价 RTX 5090 D v2 24GB,但须重新核对驱动、散热和供电,三种卡不能用同一跑分替代。[7][23]生成:Qwen3.5-9B,按官方权重转换并评测 GGUF Q4_K_M;llama.cpp / llama-server,三路槽位和上下文按实际版本配置。正式只保留一个生成模型常驻,不同时加载多套大模型。
CPU / RAM:12 核级 x86 CPU,例如 Ryzen 9 7900;128GB RAM,按主板内存兼容表选配。已有服务器按可用性能复测,不仅看核数。[24]应用:共用开源底座 S;Zulip 单独虚拟机,知识应用/数据库与推理服务分别限额。Qwen3 Embedding / Reranker 0.6B 放 CPU 工作进程,限制候选数量;CPU 过慢时减少重排或另配小卡并复测。
存储 / 配套:2TB NVMe;另备客户自有 NAS 或约 4TB 轮换备份介质;千兆内网起;电源、风道、UPS 按整机峰值功耗和目标续航选型。使用:短问答优先,默认 4k 输入/512 输出;OCR 和全库嵌入在低峰批处理。合机故障会同时影响 IM 与 AI,关键协作场景应拆机。

硬件预算:已有合格机器时仅补不足项,不设置最低采购额;新主机按约 2–4 万元作询价预算,备份与 UPS 根据现场另列。低成本不以翻新改显存卡、未知来源权重或过时无补丁系统为前提。

P2:旧应用服务器+一台 48GB 推理节点

节点具体建议配置软件与职责
推理节点1×RTX A6000 48GB;16 核级 CPU,如 Ryzen 9 7950X;128GB RAM;2TB NVMe。RTX 6000 Ada 48GB 可作为另一个供货候选,性能、价格和架构重新确认。[9][24][25]主选 Qwen3.5-35B-A3B-GPTQ-Int4+vLLM;GPTQ/Marlin 内核按实际 GPU 验证。Qwen3.5-27B 作为质量对照,选中后替换部署。Ampere 卡不能直接套用 Blackwell 的 NVFP4 跑法。[26]
旧应用服务器建议至少 12 个可用 vCPU、64GB 可用 RAM、2×2TB SSD 镜像(约 2TB 可用);已有阵列可复用。低至 8 vCPU / 32GB 只作为缩小范围后的测试配置。底座 S:IM、门户、身份、文档元数据与索引、检索、监控。IM、知识应用分别使用隔离的实例/账号;优先延续客户现有稳定 IM。
备份与内网独立 NAS/备份机按约 8TB 可用容量起规划,容量按版本留存调整;节点间千兆足够作为文本链路起点,批量附件较多可升 2.5/10GbE;沿用客户交换机与 UPS 时验明余量。数据库一致性备份+文件版本备份;备用介质不长期与生产共用可删除权限。模型节点停机期间,IM 保持服务,知识库可退化为搜索与原文阅读。

硬件预算:新增推理整机约 3.5–6.5 万元作为询价范围;旧应用节点、备份和 UPS 缺失时另补。三路标准知识问答的首选验证配置,验收目标沿用性能章节;CPU 重排耗时也必须计入首字,不能只提交 GPU 引擎跑分。

P3:生成节点不盲目加大,优先补资料治理与解析能力

硬件变化软件增加什么客户为什么需要
沿用 P2 的 48GB 生成节点;应用资源提高到 16 个可用 vCPU / 128GB RAM / 2×4TB SSD 镜像(约 4TB 可用),可复用多台旧机分担。同一底座 S,增加审核发布、版本冲突处理、批量导入任务、知识责任人、文档质量看板;启用已验证的 PaddleOCR 结构化解析管线。资料更多、更难、更常变;不因为文档数量多就宣称必须换成更大生成模型。
专用解析/检索节点:8–12 核、64GB RAM、1TB SSD、1×RTX 2000 Ada 16GB 作为低功耗候选;也可复用已有独立 16/24GB GPU。须验证各组件驱动/框架兼容。[27]本地 embedding、reranker 与 OCR 分进程、限显存和批次;在线查询优先,离线 OCR 可暂停派发。大量扫描时以样本页/小时测试排期,不承诺这张小卡包办所有实时任务。避免资料解析拖慢三人问答;若已有 GPU 可隔离使用,不要求客户重复购买。
备份容量可从 12–16TB 可用起评估,优先复用现有存储。镜像磁盘只防单盘损坏,另有独立备份。三个知识来源、一个只读业务接口;明确映射对象、字段与查询白名单。数据库恢复与文件版本恢复联合演练。支持更多资料和治理流程;本套餐仍不是应用或 GPU 的双机高可用,自动故障接管另设项目。

硬件预算:生成节点沿用 P2;已有 P2 时,解析与应用升级暂按增量约 1–3 万元询价,若需全新企业服务器、大存储或特殊质保可能超出。P3 的主要溢价对应数据治理、接口和交付责任,不保证它回答同一道简单题比 P2 更快。

X 专项:指定 Qwen3.8-Flash-Next / 96GB / 国产算力

不作为三个开源标准套餐的默认模型。Qwen3.8-Flash-Next 具有独立社区许可与商业条件,需先解决授权;再借测 96GB GPU(如 RTX PRO 6000 Blackwell 的具体可合规采购版本)+256GB RAM+4TB NVMe,并验证卸载和三路性能。国产 CPU/GPU/OS 则按厂商兼容矩阵逐项迁移。设备不必然低于 10 万;专项适配服务先做收费验证,避免预售尚未成立的性能。[2][28]

03 / CAPACITY CONTRACT

先定义“三人同时使用”究竟是什么

本方案指 3 个请求正在同时生成答案,而非三个账号登录、也非三个请求排队串行执行。一个人在 IM、网页和自动化流程中发出多个请求,也会占用多个处理名额。所有入口共用最多 3 个交互生成名额,单用户默认最多占 1 个。

AI 的并发

最多 3 路同时推理。第四个请求进入可取消的队列,显示等待状态。自动摘要与长文档任务使用低优先级队列,有交互请求时暂停派发新的后台推理。

IM 的在线人数

可以有几十或上百人在线聊天,它与 AI 同时生成数量不是一回事。IM 人数、消息量、附件和检索规模另外测算;三人 AI 并发不等于整套系统仅容纳三名员工。

建议用以下工作负载验收

输入 token 包含系统提示、历史对话、检索片段和用户问题;输出为最终回答,普通查询默认关闭长思考。Token 是模型计量单位,不能等同于中文字符数。以下均为期望达到的目标,需在选定机器上测得后才能写成合同承诺。

任务档位三人各自负载端到端首字目标 p95完整回答目标 p95使用策略
短问答2k 输入 / 256 输出≤5 秒≤25 秒制度、术语、单条资料查询
标准知识问答4k 输入 / 512 输出≤8 秒≤45 秒默认验收档,3 路同时生成
较长回答8k 输入 / 1,024 输出≤15 秒≤90 秒减少无关召回,控制历史长度
整篇文档 / 深度思考超过 8k 或较多思考 token单独测量,不沿用标准问答时延承诺异步任务;拆分、分段检索或约定等待

p95 表示至少 95% 的样本不超过该时间。首字计入认证、检索、重排、排队和提示词处理。页面先显示“正在思考”或内部推理 token,不计为首个有效答案字。此处没有把单人测试结果冒充三人性能。

倒推机器所需吞吐

标准档可按每路生成约 15 token/s 起设目标,三路合计约 45 token/s;若每路 25,则合计约 75。512 ÷ 15 + 8 ≈ 42 秒,为 45 秒目标提供直观量级参考。真实吞吐还受预填充、批处理和资源争用影响,不能把单人速度直接除以三或乘以三。

三路并发主要增加缓存和调度压力

一个模型实例通常共享权重,不需要给每个人复制一整份模型;各请求会增加 KV cache、混合架构状态缓存及中间缓冲。普通注意力和 Qwen 混合架构的缓存不同,不能用一个通用公式精确预测。工程上先按实际量化文件占用,加 3 路指定上下文、引擎开销和安全余量测量。

若三路达不到目标,依次压缩检索上下文、限制思考/输出、优化批处理与内核、改较小模型,最后再比较增购硬件;不能把“排队三个人都能问”说成“支持三路同时生成”。

04 / HARDWARE PLAN

三人使用,从单张 24GB 或 48GB 显卡起评估

预算优先:24GB GPU 配较小模型。效果和余量优先:单张 48GB GPU 配 27B / 35B 量化模型。明确要求 Qwen3.8-Flash-Next 时,再进入 96GB 级或 CPU/GPU 混合路线。

显存决定能否容纳,GPU 架构、带宽和引擎决定跑得多快。下表是采购/复用的测试起点,各档都要跑上一节的三路测试,没有任意一档可仅凭显存容量保证时延。A/B/C 是生成节点的硬件分档;套餐 P1 主要对应 A,P2/P3 主要对应 B,专项 X 对应 C,两套编号不代表同一份交付范围。

方案A · 经济基础B · 均衡推荐C · 大模型专项
适合任务制度问答、资料检索、简单摘要更复杂的知识问答、跨文档整理与办公辅助明确需要 Qwen3.8-Flash-Next 等更大模型的任务
GPU1×24GB,选择支持目标量化内核的正规渠道 GPU优先 1×48GB;2×24GB 作为需验证通信与切分的备选优先测试 1×96GB;双卡/多卡合计 96GB 不自动等价
CPU较新 8–12 个物理核心较新 12–16 个物理核心较新 16–24 个物理核心;混合推理尤其检查内存通道与 NUMA
主机内存64GB 起;合机部署整套服务建议 128GB128GB;复用旧服务器须保证可用余量256GB 优先;128GB 仅在嵌入表精度、卸载布局及负载验证后采用
本地 SSD2TB NVMe;另有独立备份介质2–4TB NVMe;系统/数据逻辑分离4TB NVMe;用于卸载时需测冷读和持续 I/O
模型基线Qwen3.5-9B 等 8–14B 级量化模型;27B 可测试,三路余量不足时不强装Qwen3.5-27B 或 35B-A3B 的适配 4 bit 版本;选择客户题库表现更好的一个Qwen3.8-Flash-Next 的已验证 4 bit / NVFP4 / GGUF 组合,先完成商用授权核查
推理引擎匹配硬件的 vLLM / SGLang;兼容性优先时测试 llama.cpp先比较 vLLM / SGLang 的三路批处理;必要时 llama.cpp模型专项引擎与固定补丁版本;CPU/GPU 混合和嵌入表卸载按配置验证
采购预算量级新整机约 2–4 万新整机约 3.5–6.5 万以 6–10 万为询价目标,可能超出,不承诺在预算内买到新 96GB 设备
三人能力判断小模型优先验证标准档;低成本但复杂任务能力有限作为三人标准知识问答的首选验证配置,通常比紧卡混合卸载更易留余量需证明更大模型带来可测收益,三人交互不可由单人跑分推断

预算为规划范围,不是现货报价;默认含基础主机,不含服务、商业授权、双机、机房改造和大容量附件存储。客户已有 CPU/RAM/机箱时按实际增购清单询价。电源、机柜风道和 UPS 由 GPU 功耗、扩展数量及整机厂商规范确定。

建议的标准交付结构

旧应用服务器+B 档推理节点

P2 应用节点按 12 个可用 vCPU、64GB 可用 RAM 和约 2TB 可用 SSD 规划,承载 IM、知识库、权限和数据库;推理节点采用 48GB GPU、128GB RAM、16 核级 CPU。8 vCPU / 32GB 仅保留为缩小资料与模块范围后的轻量测试选项。应用与推理隔离,模型升级不打断聊天服务。

账号、资料与扫描规模按各套餐首次交付范围验证;资料导入量不是无条件容量保证。大批 OCR、复杂解析栈与附件增长时提高资源或拆服务节点,并实测。

预算压低时

一台工作站合并部署

先用 A 档+128GB RAM,IM、知识库和推理分容器/虚拟机,设置 CPU/RAM 限额、数据库独立账号和备份。选小模型守住三人交互,资料解析错峰运行。

合机可以便宜,但整机故障会同时影响 IM 和 AI;容器隔离不等于高可用。若 IM 承担日常关键协作,优先把它留在原有稳定服务器上。

同是“能装下”,余量差别很大

模型档位纯 4 bit 权重下限实际选型解释
9B约 4.5GB实际量化文件更大;24GB 为三路状态缓存和运行开销保留空间。
27B约 13.5GB24GB 可作为测试候选;为三人、检索上下文和较稳定余量,48GB 更从容。
35B-A3B约 17.5GBvLLM 配方列有单 24GB INT4 路线,但不等于任意上下文三路均达标;标准产品优先测试 48GB。[4]
Qwen3.8-Flash-Next主体、嵌入表、MTP 简化合计约 90GB这不是显存需求;不同部分可按引擎放到 GPU、RAM 或 SSD。精度和卸载路径会显著影响三人吞吐。[1]

下限按参数量×4÷8 计算,未含量化元数据、未量化部分、视觉部分、上下文缓存和临时缓冲;GB/GiB 也应区分。Qwen3.8 的 51B 嵌入表若保留 BF16,单表约 102GB 主存,不能拿“模型总量化 4 bit”推断该表也量化了。

Qwen3.8 的证据与备选路线

官方模型为 125B 主体、每 token 激活约 6B,另有 51B n-gram 嵌入表和 MTP;激活参数小主要降低计算量。vLLM 官方 FP8 配方的权重容量与验证设备仍较大,低预算重点在量化和卸载路线。[1][3]

双 RTX 3090+64GB RAM 的作者实验给出了特定 GGUF 方案约 33–40 token/s 的单流结果;也有单 RTX PRO 6000 96GB 的专项部署仓库。这证明研发方向可行,没有为上述三路目标提供现成保证。双 3090、128–256GB RAM 可作为约 3–6 万的混合研究配置,先借测再决定采购。[5][6]

Mac Studio/128GB GB10 类统一内存设备,可作为安静办公室和低并发替代;先验证特定架构支持与三路速度。DGX Spark 的 128GB 内存与 273GB/s 带宽,不能直接等价成独立大显存 GPU。已有国产加速卡按厂商支持清单选模型,另核操作系统、量化算子和采购适配要求。[8]

采购写清精确型号。例如 RTX 5090 D v2 官方为 24GB、无 NVLink;RTX A6000 为 48GB。它们只是容量示例,架构、保修和市场供货不同,不能只凭名称相近替换。[7][9]

优先:旧应用服务器+48GB 推理节点

旧机承载 IM、资料、权限和检索;48GB GPU、128GB RAM、12–16 核 CPU 的推理节点,测试 27B/35B 4 bit 模型。

以 3 路、4k 输入、512 输出进行验证;通过后确认生产配置。此处输出为选型建议。

05 / ADAPT THE EXISTING

现有硬件适配,是一项可收费、可验收的服务

先回答“原设备怎样用最合理”,再决定是否补卡、增内存、换 SSD 或增加独立计算节点。旧服务器的价值不仅在跑模型,也在继续承担稳定的应用服务。

现有资产建议复用方式重点验证
较老 CPU 服务器、无 GPUIM、文档、认证、备份和部分检索;GPU 推理独立部署可用资源、SSD、系统寿命、安全补丁,不挤占原业务
有 24GB GPU先跑 9B/小模型三路基线;27B/35B 做可选对照显存余量、引擎内核、三路缓存、散热与保修
有 48GB 或更多显存优先验证 27B/35B 生产版;视情况评估更大模型单卡/多卡拓扑、量化支持、输入长度和并发
大内存双路服务器低频任务或 MoE 混合推理研究;只在实测有价值时使用内存通道、NUMA、CPU 指令集、冷读;大 RAM 不等于快
多台旧服务器分别承载 IM、检索、OCR、备份;必要时跑独立模型副本普通网络不作跨机切分大模型的默认方案
国产 CPU / GPU / 特定系统选择厂商支持的模型与引擎,单列兼容性项目硬件、驱动、量化和模型架构四者须共同支持

现场适配要交付四份东西

  1. 资产与约束报告CPU、GPU、可用内存、NUMA、PCIe、存储、网络、电力、保修、现有业务峰值及安全要求。
  2. 最小增购清单给出零增购、最小增购、增强三个选项;明确原设备保留的价值和能力限制。
  3. 调优前后对比在相同模型、精度、题目和三路负载下记录时延、吞吐、内存、错误率与效果;更换模型的结果单列。
  4. 可重复运行的配置固定驱动与镜像版本、启动配置、权重哈希、备份、回滚和操作手册;另一位工程师能够接手。
适配必须有边界

先做短期兼容性评估,再承诺生产适配。旧机器不适合时提交停止调优建议;为节省几千元设备反复投入大量工程时间,可能使客户总成本上升。

06 / OPEN SOURCE / 一套底座、分层扩展

软件技术路线:以可修改、可交付、可维护为优先

建议把三个套餐做成同一产品:开源组件负责成熟能力,我们只开发连接层、权限闭环、简洁门户和业务适配。首批客户优先 P1/P2,P3 功能按已验证模块逐步开放。

共用底座 S(拟建产品,不是已经完成的软件)

Vue 3 门户+FastAPI 服务+Haystack 管线+PostgreSQL / pgvector+本地 OCR / embedding / reranker+Keycloak+Zulip+独立模型接口;监控、备份和安装脚本统一版本化。我们拟开发的门户、网关和通用连接器建议采用 Apache-2.0 并交付源码;客户私有配置和业务资料不进入公共仓库。

层次 / 开源组件具体用途与搭配我们的定制边界
Linux+Docker Engine / Compose优先采用支持期内、经验证的 Ubuntu LTS;AI 应用用 Compose 和 systemd 管理,Zulip 独立 VM 按官方方式安装。生产不用 latest 镜像,默认不为两三台机器增加 Kubernetes。离线部署、驱动与 CUDA 版本匹配、资源限额和回滚。开源应用不代表 NVIDIA 驱动、CUDA 或所有系统组件也都是开源;这些依赖单列许可,Docker Desktop 不是服务器必需品。
llama.cpp / vLLM分别为 MIT / Apache-2.0;P1 用 GGUF 兼容性路线,P2/P3 用 vLLM 批处理路线,提供仅内网可访问的模型接口。[29]每个已支持 GPU 固定一个模型与量化配方;上下文上限、批次、并发、超时和性能参数写入配置档。兼容协议不等于调用云端。
Qwen3.5 / Qwen3 检索模型本方案选用的 9B、27B、35B-A3B 和 0.6B 检索模型官方卡标注 Apache-2.0;量化衍生物另保存来源、哈希与许可。[4][14][26]行业术语与提示模板、客户题库选型、量化前后质量对照。不能由一个版本许可推断所有后续 Qwen 模型相同。
Vue 3+FastAPI二者主项目为 MIT。门户仅做问答、原文引用、资料管理、反馈与任务状态,后端做身份校验、ACL、审计和三路调度。[30]名称、配色、首页、模板、字段映射。权限由服务端决定,不能相信前端传来的部门 ID;不提供任意脚本执行或无边界 Agent。
Haystack+PostgreSQL+pgvectorHaystack 核心 Apache-2.0;PostgreSQL 与 pgvector 为 PostgreSQL License。业务元数据、文档版本、向量和关键词检索集中管理,原文件放客户本地文件卷/NAS,经应用授权访问。[31][32]知识入库与检索管线、权限过滤、答案出处、版本迁移。中文全文检索增加 jieba 分词和企业术语词典,保持查询/索引分词一致;PostgreSQL 默认分词不能直接当成优质中文搜索,也不把其全文排名冒称 BM25。[33]
PaddleOCR+本地文件解析PaddleOCR 主项目 Apache-2.0;PDF、Office 文档先按类型提取,扫描件走本地 OCR;复杂表格在 P3 验证结构化解析。解析库、模型权重、字体各自核查,不能只看外层项目。[34]页码/标题保留、页眉去重、断行纠正、表格规则和失败队列;上传沙箱禁宏、限制文件大小与解析时间,防压缩炸弹。
Keycloak+Zulip主项目均为 Apache-2.0。无现有身份系统时建本地 Keycloak,门户用 OIDC;Zulip 采用已支持的 OIDC/SAML/LDAP 方式。已有合适身份平台则复用。[10][35]组织与用户映射、停用联动、私聊机器人及少量品牌配置;统一登录与文档授权分别实现。严隔离用内部 DNS、证书与 SMTP,不依赖社交登录。
Valkey+Prometheus / Alertmanager+resticValkey 为 BSD-3-Clause,用于跨入口限流/短期任务状态;Prometheus / Alertmanager 为 Apache-2.0;restic 为 BSD-2-Clause,负责加密文件备份。数据库用一致性导出,P3 可增加 MIT 的 pgBackRest。[36][37]调度状态丢失时停止接收新生成请求,核对引擎活动任务再恢复,避免并发超限;任务结果与资料状态持久化到数据库。仪表盘做在轻量管理页,默认不引入另一套云监控。

这是主要项目的许可核对,不是整套镜像已完成法律审计。Zulip 和各组件自带的数据库、队列、系统包照其受支持组合部署,不能因为我们使用 Valkey 就擅自替换上游依赖。发布时交付 SBOM、锁定版本、许可证与 NOTICE、修改说明;GPL/AGPL 等依赖按其分发/网络交互条件履行源码义务。商业收费与开源可以同时存在,开源不等于免除许可条件。

现成大平台怎么取舍

候选建议
RAGFlow主项目 Apache-2.0,可作为“需要成熟知识管理界面”的替代分支;完成依赖与权限实测后,用它替换相关 Haystack/知识管理模块。不要在同一首单同时维护两份索引与两套文档权限。其管理员/租户能力不自动等于源文档逐人 ACL。[13]
Dify / Open WebUI可在遵守其附加许可条件的范围内使用;Dify 涉及多工作区与前端标识条件,Open WebUI 涉及品牌条款和例外。它们不作为“任意改标、无限复制交付”的默认底座;客户指定时核对实际版本与使用形态,必要授权由合同列明。[18]
LibreChat主项目 MIT,是现成聊天界面的可用候选;引入前核对包含 MongoDB 等在内的运行依赖及许可,并禁用绕过我们权限网关的文件检索路径。为降低首批维护面,标准包先用简洁门户与 IM,不同时部署多个聊天前端。[38]

第一版真正需要开发的五块

  1. 统一网关:校验登录与机器人身份、映射员工、总并发 3、排队/取消、输出审计。
  2. 知识服务:资料目录、源文件权限与版本、受控引用、更新/删除、反馈闭环。
  3. 简洁门户:问答、出处、任务状态、管理页,不从零重写整个 IM 或低代码平台。
  4. 连接器:先做文件目录与 Zulip;再做一个行业高频只读业务接口,每个接口维护契约测试。
  5. 交付工具:配置化安装、检查、备份恢复、诊断导出、版本回滚与验收报告。

通用功能合并回同一主分支,客户差异放配置、模板与插件;维护受支持的 N / N−1 两个版本,明确支持结束日期和迁移安排。最初几家客户的目标是形成可复用产品资产,不能每签一家就复制一份无法升级的独立源码。

07 / THE INTERNAL AI SUITE

内部 IM、知识库与 AI,组成一个日常工作闭环

模块客户实际获得的能力默认交付边界
内部 IM私聊、团队频道、文件交流、可控账号;从 IM 使用 AI优先复用已有合适 IM;新建时评估 Zulip,特殊要求评估商用私有化 IM
企业知识库制度、手册、项目资料与批准案例可检索;答案有原文和版本第一期限定来源、文档数/页数、扫描比例、权限组与更新频率
本地 AI 助手文档问答、摘要、草稿、信息整理;多入口共用模型最多 3 个交互生成请求;深度思考、整篇长文档另走任务队列
身份与组织权限岗位、部门、离职停用和文档可见范围一致无现成目录时使用本地身份管理;P2/P3 含一个标准目录对接;单点登录不自动继承全部文档权限
工作流与连接器经批准的聊天摘要入库、资料更新、只读业务查询从只读开始;审批、发送和业务系统写回另约权限、确认与撤销机制
管理与维护服务状态、资料更新、备份、审计、故障恢复与迁移客户持有管理权;日志按最小必要保留,不默认保存全部敏感正文

IM 选型:先验证习惯与边界,再安装

Zulip 可自托管,主仓库采用 Apache-2.0,适合按频道与话题组织讨论;可作为首选验证项,但应让客户试用中文客户端与话题交互,确认是否符合习惯。Mattermost 可作为候选,其当前免费 Team Edition 官方定位不推荐用于政府或敏感商业工作负载,此类客户应核对适用商业版本与功能授权。[10][11]

本地部署 ≠ 手机推送完全不经过外部网络

Zulip 官方移动推送涉及转发服务及 Apple/Google 推送链路,并有计划与版本条件。严格隔离环境默认关闭此类外联,优先保障内网网页/桌面在线消息。手机后台到达、移动办公、音视频会议单独设计与验收;加密推送也不等于没有外部依赖。[12]

IM 接 AI 后,最容易遗漏的是群内泄露

第一版知识问答默认由机器人私聊回复提问者。若在群中直接回答,不能仅按提问者的权限检索,否则会把他有权看的内容发给群内无权成员。群答只能使用对该频道全部可见成员都允许公开的知识范围,并考虑历史消息可见性、新成员加入、访客与转发。难以保证时改为私聊结果与受控引用链接。

机器人使用最小权限,读取指定频道或明确选择的消息,不全局监听所有私聊。聊天记录也不自动成为公司知识:由有权人员选择 → 生成摘要草稿 → 人工审核 → 标记知识归属与可见范围 → 发布入库;来源删除、权限收回和版本变化需要同步处理。

知识库技术基线

从本地 OCR、文档切分、关键词+向量检索、重排及引用定位做起。标准包采用前述底座 S 的 Haystack+PostgreSQL/pgvector;复杂解析优先扩展同一管线,RAGFlow 作为另经评估的替代分支。嵌入与重排可测试 Qwen3-Embedding-0.6B、Qwen3-Reranker-0.6B,优先放应用节点或专用资源,避免和三路生成争抢显存。[13][14]

所有检索入口必须在文本进入模型前执行服务端权限过滤;原文、向量结果、关键词结果、缓存与下载接口共用权限约束。主聊天模型在本地,若 OCR、embedding、重排、日志或备份调用云服务,整体就不满足严格本地要求。[15]

先做 RAG,再根据重复失败决定是否微调。微调可改善固定格式、术语与流程习惯,不能替代资料更新、删除、出处与权限。金额、库存、编号和汇总优先从只读数据库或确定性代码得到,模型负责解释结果。

08 / KNOWLEDGE ENGINEERING / 从资料到可核对的回答

知识库怎么搭,决定了 AI 在企业里有没有用

不是把所有文件丢给模型,也不是给每个客户训练一个新大模型。第一期建立“找得到、看得懂、查得回、更新得了、权限管得住”的资料体系。

  1. 盘点与授权:先选有价值的资料按制度、产品手册、项目资料、案例分类;确认知识责任人、使用者、保密等级、有效版本和更新周期。先用 200 份高频资料做样本;客户员工私人目录、聊天和无权复制的资料不自动纳入。
  2. 建立资料清单和权限矩阵每份资料记录 source_id、document_id、版本、hash、负责人、生效/失效时间、允许用户/组、删除状态、同步时间与原位置。来源无法提供逐文档权限时,建立经批准的独立发布目录,P1 使用明确的资料集/部门级权限,不能伪称已完整继承复杂 NTFS ACL。
  3. 本地解析、检查、分段正文型 PDF/Word 提取原文;扫描件 OCR;Excel 保留列名、单位、工作表和行号。按标题/段落切分,初始约 300–600 token、重叠约 50–100,按真实问题调参。表格保留表头与记录关系,切片不混入不同权限文件。
  4. 建立检索索引Qwen3-Embedding-0.6B 将批准片段向量化;向量与模型版本一起记录。PostgreSQL / pgvector 存向量,分词后的关键词与术语精确匹配补充产品型号、编号、缩写。Haystack 管线组合召回,不依赖云服务。
  5. 查询、重排与带引用生成先确认用户当前权限与有效版本,再做向量/关键词双路候选;初始各取约 15–20 条,去重后按 CPU/GPU 预算重排 10–20 条,最终取约 4–8 段,并把系统/历史/片段合计控制在 4k 默认输入内。片段数量不能突破 token 预算;无法充分回答时澄清或转异步任务。
  6. 发布、更新、删除与复评先解析到暂存版本,通过抽检后原子切换可见版本;新文件失败不覆盖当前可用版。权限收回/删除优先进入拒绝清单,再删除切片、向量、缓存;每日检查同步积压。业务负责人处理错误反馈,定期更新盲测题。

以上切分、召回和重排数量是工程起点,不是通用最优参数。Haystack/pgvector 提供检索过滤能力,完整权限策略、引用和版本闭环属于我们要实现并验证的产品工作。[31][32]

三个具体效果例子

客户提问应该交付的结果能力边界
“外地出差住宿标准是多少?”依据当前有效制度,区分城市/岗位条件,附文件版本和页码;条件缺失时反问。仅能用已入库、提问人可见的制度;旧版冲突时提示并请求业务负责人确认,不能自行确定哪份有法律效力。
“这台设备出现 E17,先检查什么?”精确匹配型号/版本/故障码,列出手册中的步骤和安全说明,链接原章节。相似型号不能混答;可能影响人身或设备安全的操作由有资质人员核对,资料缺失时不编造步骤。
“本月 A 产品还有多少库存?”P3 的只读接口按登录人权限查询批准的数据库视图,由确定性查询返回数字与时间戳,模型解释。知识库内的旧 Excel 不能作为实时库存。第一版使用字段白名单和固定查询模板,不允许模型自由执行任意 SQL 或写回 ERP。

怎样量化“效果还不错”

沿用统一验收中的可用答案率 ≥85%、引用支持率 ≥95%、无依据处理 ≥90% 作为试点目标;文档集、任务类型和分母先确定,P1/P2/P3 不共享一张伪造的全行业正确率。另抽检解析质量、关键数字/表格结构,记录 Recall@k(有标准证据的题,检索是否取回证据)、权限用例和同步延迟。业务专家按未用于调参的题核对,不能由模型自评代替签收。

可以争取达到

自然语言找资料;在授权范围内跨文档整理;答案能回到出处;新版本发布后生效;没有证据时明确说明;员工在 IM 中直接使用。

不能包装成承诺

全库任意问题都正确;低清扫描和复杂图纸全部读懂;一次入库后永久不用维护;模型自动具备 ERP 实时数据;单靠提示词保证权限与安全。

权限、索引与历史答案必须一起管理

应用查询同时带组织、资料集、用户/组、版本和删除状态;关键词与向量检索都使用同一授权范围。小范围先做精确检索,数据增长再测试 HNSW;近似检索加过滤可能减少召回,要通过候选扩展、分区或精确回退解决,不能只在全库前几条结果上事后删掉无权内容。

原文下载、预览、引用链接都重新鉴权,不暴露 NAS 的直链;权限不明时拒绝提供正文。服务端收到撤权事件后立即阻断;P2/P3 的源系统轮询可先定 5–15 分钟,无法接受这段延迟的资料需事件联动或查询时再核权。目录服务不可用时优先拒绝敏感查询。

门户里的历史回答本身可能含敏感内容:记录其依赖的文档与权限版本,重新打开时校验,权限变化后限制显示并失效缓存。IM 中已经发送的正文由 IM 自身保存,通常无法随文档 ACL 自动重新鉴权;对高敏资料,机器人只发送不含敏感内容的提示与受控门户链接,不直接发送完整答案。已经被员工阅读、复制或合法导出的内容不能技术性“收回”,所以机器人知识问答默认私聊、群答另做全员可见范围审查。备份中的旧数据按约定留存期限清除;恢复时先重新应用删除/撤权清单再开放访问。

更新与存储的可交付规则

  • 新增/修改:P1 人工批准后批量导入;P2/P3 定时发现、排队解析、审核发布。先约定“发现频率”,再实测“可搜索时延”,不能把轮询间隔当成全部入库时间。
  • 容量:原文件、OCR 中间文件、切片、索引、数据库和历史版本分别测量。举例:10 万片段 × 1,024 维 × 4 字节约 0.41GB,只是原始 float32 向量;索引、正文、备份和图片另计。向量维度依据所选检索模型固定。[14]
  • 模型更换:更换聊天模型主要复评答案与性能;更换 embedding 模型通常需建立新索引、全量重新向量化并切换,成本与窗口单列。
  • 客户分工:我们负责工具、解析调优、索引和故障;客户负责资料合法性、有效版本、授权与业务正确性判断。每个知识域至少指定一名负责人。
09 / DATA BOUNDARY / 默认不需要云端 API

云端是主动选项,不是隐蔽的性能补丁

P1/P2/P3 都可以设计为无云端模型 API 的日常运行方案。生成、OCR、embedding、reranker、知识存储、日志和备份全部在客户环境完成;上云不会因为本地模型“答不好”而自动发生。

运行模式什么会出本地如何控制 / 如何收费
L0 严格隔离生产业务不连接外部 API。安装/更新包在外部受控环境准备,经客户批准介质导入;没有在线模型下载、遥测、许可证联网校验和云备份依赖。现场或离线工单维护;内部 DNS/NTP/CA/SMTP,必要依赖一并离线化。云调用费为 0,但有离线包验证、介质和现场服务成本。
L1 本地业务+授权远程运维AI 数据默认留本地;客户可开放临时堡垒机/VPN 维护,批准时才导出脱敏诊断。远程屏幕若显示原文,也构成供应商接触数据,需要受控。账号实名、MFA、时限、命令/会话审计,默认不留永久外联隧道。可采用标准年度服务包;不因此启用云端 AI。
L2 可选混合增强仅经批准的公开/可外发任务发送云端模型;可能包括问题、历史、附件及检索片段,必须明确实际范围。脱敏后的内容仍可能被重识别。独立云入口、显示供应商与数据范围;按角色/资料等级允许,发送前确认;网关域名白名单、用量预算和审计。客户自持 API 账号直接付费,我们收接入与维护服务费。

防止“主模型本地,配套服务却在外网”

部署检查覆盖:OCR/embedding/reranker、联网搜索、网页抓取、Agent 工具、邮件、错误上报、日志、备份、字体/CDN、软件统计、插件市场、远程文件预览、模型下载及移动推送。Haystack 提供遥测控制,应按冻结版本关闭并用网络证据验证;不能只相信配置文件里写着 offline。[39]

验收时阻断生产外网,冷启动后实际完成登录、三人问答、资料解析/更新、IM、备份与恢复;检查 DNS、防火墙和代理日志。API 路径长得像 /v1/chat/completions 只表示接口协议相近,真正的目的地址必须是客户内网节点。

混合模式的默认规则

内部知识问答保持本地;公共写作可由用户主动选择云端。禁止“本地报错自动回退云端”、禁止带着整段私有历史静默切换;关闭云入口后仍应具备本地核心能力。具体供应商、境内/跨境处理地点、留存/训练政策按采购时实际条款核对,不预先承诺统一的零留存或数据合规。

云端接入示例服务费见定价章节;token 费用按供应商账单实报,不虚构固定每月消耗。手机后台推送和外部短信属于独立外联,也要进入同一张出网清单。

10 / ENGINEERING VALUE

把“调优”变成客户看得见的交付

服务工作具体做什么可验收结果
运行环境适配驱动、量化内核、虚拟化/容器、PCIe 与模型架构兼容固定版本清单,重启和安装可复现
显存与主存布局权重驻留、三路缓存、卸载、NUMA 和峰值余量指定负载不 OOM;冷/热启动与占用记录
三路交互调度连续批处理、请求限额、取消、超时、长任务队列3 路同时有效生成,第四路有明确等待反馈
知识检索调优解析、切分、混合召回、重排、上下文压缩、权威版本真实题库的答案与引用质量改善
IM 与权限联调账号映射、机器人权限、私聊/群答边界、文件引用不越权、不串会话,账号停用后权限失效
稳定性保障资源隔离、日志、备份、恢复、版本回滚与培训72 小时混合负载与恢复演练记录

量化、MTP/投机解码和前缀缓存都要 A/B 测试,不能预设“打开一定更快”。前缀或结果缓存必须按用户/权限范围隔离;长文档任务不能耗尽三个人的交互资源。KTransformers 可作为已有支持架构的异构候选,本次未在其主 README 核实 Qwen3.8 专项配方,不把通用 MoE 支持当作该模型已经适配。[16]

统一验收包

建立约 150–300 道客户真实问题,划分开发集与未参与调参的盲测集;包含常见查询、表格、跨文档、数字、无答案、过期文档、越权及文档提示注入。由业务专家核对原文,大模型评分只能辅助。

指标建议门槛说明
可用答案率≥85%对有答案且有权限的题,重大事实错误不算“可用”
引用支持率≥95%检查事实是否有引用支持,不只检查是否显示链接
无依据处理≥90%无依据时说明不足或澄清,不编造制度
权限与群聊边界约定用例全部通过发生泄露阻断上线;通过有限测试不代表绝对无风险
三路性能按“三人性能标准”章节负载目标至少 100 组三请求同时触发,另做稳定并发与混合长短请求测试
可靠性与恢复72 小时混合负载;完成一次真实恢复数据恢复点与恢复时限按备份/备用设备能力约定

所有门槛均为谈判起点,试点后确认。压测记录模型/权重哈希、引擎提交、量化、输入输出、三路并发、思考模式、缓存命中、首字、完成时间、错误率和资源占用。可用 vLLM bench serve 等官方工具测试引擎,再测 IM/网页到答案的全链路。[17]

11 / OPERATIONS / 可复制的维护,才有持续服务利润

高效运维:固定组合、可诊断、可回滚

不要靠工程师记住每家客户机器上改了什么。每家客户交付同一套工具和独立配置;数据留在客户处,供应商集中维护的是版本、兼容矩阵和脱敏工单。

频率 / 事件自动检查处理方式
持续监控GPU 显存/温度/错误、CPU/RAM/磁盘、队列、首字与完成时间、请求失败、检索耗时、证书期限、IM 可用性。Prometheus / Alertmanager 在本地报警到客户管理员;经许可发送脱敏健康指标。无远程监控许可时,供应商不能承诺主动发现所有故障。
每日自动任务备份是否成功、同步积压/失败、资料解析失败、账号停用与 ACL 同步、磁盘增长。失败任务可重试并告警;无法同步权限时暂停相关资料访问。CPU/GPU 紧张时降低后台并发,不抢占三个交互名额。
月度/季度服务按购买档位巡检、容量预测、重复问题归因、安全修补评估、题库复评和恢复抽查。输出一页报告:问题、影响、措施、需客户决定的项。服务工时有限,批量人工整理资料不藏在“维护”中。
升级发布测试环境先跑固定题库、三路压力、权限/删除、脱网和恢复测试;检查数据库迁移。维护窗口内先备份、后升级;保留上一版镜像/模型/配置。不可逆数据库迁移不能只换回镜像,需经过验证的备份恢复路径。
故障工单客户一键导出诊断:组件版本、脱敏配置、错误代码、时延与容量,默认不含正文、密钥和完整提示词。客户预览批准后传出;可远程时用短期账户,隔离环境用离线诊断包与签名补丁。紧急安全事件优先隔离/撤销令牌,再恢复服务。

备份不是复制正在运行的数据库目录

小型部署用一致性数据库导出,文件及配置用 restic;规模和恢复点要求提高后采用 pgBackRest/WAL 归档。备份包含 IM 数据库/附件、知识原文/版本、ACL、门户配置、身份系统以及恢复所需密钥;模型权重可从可信离线包重建,不能因此漏掉无法重新生成的业务数据。Zulip 自有备份流程也要纳入整套恢复。[37]

基础恢复目标:供试点确认

每日备份可先把 RPO(可接受丢失的数据时长)定为 ≤24 小时;有健康备用环境且资料规模受控时,RTO(恢复时长)先以 1 个工作日测试。单机硬件损坏、无备机或等待到场时,不沿用这个恢复承诺。

增强恢复需有额外基础设施

要争取 ≤1 小时 RPO、≤4 小时 RTO,需同时覆盖数据库、文件、密钥、备用节点和恢复演练;它们不是“买 P3 / 多付维护费”就自动获得的能力。热备、高可用和异地容灾单独设计。

供应商内部必须形成的标准件

  • 兼容矩阵:GPU 精确型号 → 驱动 → CUDA/框架 → 引擎版本 → 权重哈希 → 量化 → 三路结果;“48GB 卡”不是充分描述。
  • 交付清单:部署脚本、配置模板、密码初始化、端口与防火墙规则、数据目录、备份/恢复、SBOM、版本与支持周期。
  • 升级纪律:只从受审查仓库制包;禁止自动拉 latest 或静默升级模型。多客户先小范围试运行再扩展,客户私有资料不进入中央测试集。
  • 退出机制:不续费可继续运行已交付版本;提供约定的数据导出和源码/脚本,撤回供应商访问权限。续费购买的是支持、更新与约定治理服务,不用远程停机逼续费。
12 / PRICING / 以交付责任与业务价值收费

产品与服务怎么定价:标准实施+选配+年度支持

给客户的正式报价拆成四栏:硬件采购、实施/定制服务、年度维护、外部授权/API。开源组件本体按其许可免费使用,我们收费的对象是适配、集成、资料建设、验收和持续服务。

建议先试行这组价格,再用首批项目的真实工时调整

P1 ¥19,800、P2 ¥39,800、P3 ¥69,800 为各自标准范围的实施服务建议起价;普通硬件适配已包含在相应标准包,不能再次收一笔相同“调优费”。兼容范围外的 GPU/OS、复杂连接器与治理另作变更。

本节所有服务金额按人民币、未税规划口径展示,不是第三方市场报价。对外报价单应给出适用税率、含税总额、差旅及授权,并写明有效期。硬件预算为独立询价范围,不能直接与未税服务价相加后宣传含税总包价。

服务建议收费必须写清的交付范围
初访 / 收费资产评估首次需求沟通免费;正式评估 ¥2,000–5,000一处现场/约定远程环境、限定机器数;盘点、兼容风险、最小增购清单与路线建议。只有扫描机器参数不算模型效果试点。
两周可行性试点¥6,800–12,800一场景、200 份/2,000 页样本、三个权限组、三路性能、可演示知识问答与结论。开始前确认访问条件;在 60 天内转正式套餐,可抵扣已完成且可复用的工作,最高不超过已付试点费,不能重复计价。
P1 / P2 / P3 实施¥19,800 / ¥39,800 / ¥69,800 起按套餐表的账号初始化、来源、资料上限、模块、模板、培训和评测范围;含标准栈安装调优、离线运行配置、备份及一次恢复演练。以共同底座已具备这些功能为前提。
现有机器专项适配¥5,000–20,000 / 经界定的专项仅用于标准矩阵外的虚拟化、旧驱动/多卡/NUMA/国产栈等;先限定探索工时和成功指标。可单独购买,不以已装好我们的整套系统为条件。
额外业务连接器¥5,000–15,000 / 标准只读接口起一个有文档的 API/数据库视图、一组对象字段、一种身份/权限方式、一类查询;ERP 写回、审批、历史迁移和供应商接口费用另估。
额外知识治理先抽样,按批次或约 ¥1,500–3,000 / 人日报价以页数、扫描/表格难度、人工校验量、权限整理量计;不只按 GB。普通自动入库不重复收成“训练费用”,复杂资料先拿 50–100 页样本评估。
客户指定云 API 接入¥3,000–8,000 / 单供应商起独立入口、角色/资料等级限制、审计与预算;API 账单由客户自付。提供公开写作能力时也不能默认允许内部检索片段外发。
大模型 / 高可用 / 涉特殊采购约束先收费验证,后单独报价Qwen3.8 授权与硬件、国产平台、双机/灾备、现场驻守、指定安全测评分别设计;不把它们塞进 P3 起价。

年度服务包:客户可以独立选择,不与 GPU 档位强制绑定

建议年费支持与巡检工时 / 变更范围
基础支持 ¥6,800 / 年工作日 9:00–18:00(北京时间);严重故障 4 个服务小时内响应,普通问题 1 个工作日;季度巡检、年度恢复抽查。含 12 小时人工支持、每年 1 次约定的小版本维护窗口。适合客户有 IT 人员负责日常操作;巡检、升级与故障处理都计入该工时池。
标准支持 ¥12,800 / 年同一服务窗口;严重故障 2 个服务小时内响应,普通问题 1 个工作日;月度远程/离线巡检、年度恢复演练。含 24 小时人工支持、每年 2 次约定的小版本维护窗口、一次固定题库复评;同样计入工时池,超额先报价。
增强支持 ¥24,000 / 年同一服务窗口;严重故障 1 个服务小时内响应,普通问题 4 个服务小时;月度巡检、季度效果回顾、每半年恢复演练。含 48 小时人工支持、每年最多 4 次约定的小版本维护窗口。复杂治理、新接口、大模型迁移、现场差旅另计。

“服务小时”仅在约定工作窗口内累计;严重故障指核心服务整体不可用或疑似重大越权。响应指确认、分级和开始诊断,不是修复承诺;硬件换件与第三方故障按相应主体处理。无远程权限时响应可先电话/离线指导,不自动变成到场时限。超额支持可按约 ¥400–600 / 小时或预购工时包,先批准再执行;24×7 与驻场需另行配置人员。

质量保证与续费分开:建议生产验收后提供 90 天合同范围内实施缺陷修复,不消耗付费支持工时;新需求、上游升级和客户变更另算。年度支持可从验收日启动,提供巡检和运维服务;不买年包仍享约定缺陷保证,但没有持续巡检与年度更新服务。

一个便于谈判的报价结构

客户已有合格 48GB GPU 与应用服务器,选择 P2:
实施服务 ¥39,800+自选标准年维 ¥12,800=首年服务预算 ¥52,600(未税);设备不足项由客户按审核清单直购,云 API 默认不启用。如已有可复用试点成果,再从实施部分抵扣相应已付费用。

客户只要基础功能且已有 24GB 机器,可改选 P1;客户只有 10 万元全部预算时,先把设备、含税服务与首年维护放在同一张预算表内,不直接推荐满配 P2/P3。

报价底线与套餐升级

先估直接交付工时、外部协作、质保返工和售前投入,再留出维护风险及合理利润;若覆盖不了,缩小范围或提高价格。客户能感受到的业务价值用于判断是否值得采购,不用未经验证的节省金额支撑高价。P1 升 P2、P2 升 P3 时按可复用模块和新增工作报价,不要求重买全套;已有第三方系统也可只买我们的评估、调优、连接器或维护服务。年度支持按实例数量、维护窗口、接入条件与人工投入报价,不能仅按硬件金额抽成。

为什么客户愿意付这笔服务费

销售交付物应包含“改造前后同负载测试、权限与资料更新演示、可核对的答案、可恢复的系统、可交接的文档”。用客户的高频任务评估净节省时间,扣除原文核对和维护投入;节省工时不自动变成现金收益。政务复用上级模型时,按实际知识治理、接口和维护工作报价,未实施的本地模型安装调优不计费。若主要需求是偶尔写公开文案、允许上云,则低频云服务可能更合适,不强推本地项目。

折扣优先交换更小的资料范围、更少接口、更宽维护窗口或分期交付,保留权限、备份与验收。企业项目可商谈 40% 启动 / 40% 试运行 / 20% 验收等节点,实际遵守客户采购流程;不垫付大额硬件。固定范围后报价,变更有明确增量与签收人,避免把“可定制”卖成无限开发。

13 / GO TO MARKET

先从一个部门的真实问题获得首单

优先客户第一场景进入条件
制造与设备服务企业售后手册、技术资料、维修案例+内部协作已有资料、业务负责人愿意评测;涉及设备安全的处理由专业人员复核
工程咨询与技术服务机构项目资料、规范查询、材料出处核对版本、版权与跨项目权限能够明确
专业服务机构内部制度、资料整理、草稿辅助保留专业人员最终判断,不承诺自动完成高风险决策
学校、事业单位非涉密部门办事指引、部门知识与内部沟通采购路径、资料使用批准、IT 与验收人明确;涉及政务领域的部署,另执行 G1 的建设路径核查
大型国企与政府单位已有平台的局部知识与 AI 能力补充政府部门先确认上级资源、建设路径及模型准入,优先提供知识治理与平台接入;国企另按自身采购和安全要求评估。可与合适集成商合作,不借用资质

推荐从有关系入口的制造或技术服务企业开始。首单不要求客户一次更换所有办公软件:先在一个部门部署/接入 IM 与知识助手,稳定后扩展。已有 IM 满足要求时,服务重点转为 AI 接入与知识治理,减少迁移阻力。

首次沟通的开场

“我们先利用贵单位已有设备,验证三个人同时查内部资料的体验;同时把内部聊天、知识库和 AI 接起来。硬件可以由您直接采购,我们收取适配、调优、部署和维护服务费,按事先约定的效果验收。”

用一次 45 分钟会议确认:具体任务如何做、资料谁能批准、谁使用与验收、现有机器情况、峰值三路的输入规模、IM 总人数、网络边界、预算范围和采购付款路径。没有资料负责人或验收人,不进入长期定制。

演示顺序

  1. 在 IM 私聊里问一条真实业务问题使用批准资料,展示原文页码与版本。
  2. 三个人同时发起请求展示三路有效答案流及第四路排队;测首字和完成时间。
  3. 切换无权账号并检查群聊边界展示私有资料不会出现在不合适的会话或引用中。
  4. 更新文档,再次查询展示旧版失效、来源更新与删除同步。
  5. 把批准的讨论整理成知识草稿经审核后入库,让客户看见协作与知识沉淀的闭环。
客户异议回应方式
“硬件价格网上都能查。”“可以直接采购。我们给出兼容性清单,服务单列适配、三路调优、IM/知识库集成和维护。”
“我们有服务器,为什么还要买?”“先提供零增购可达到的结果,再比较最小增购;能继续使用的部分都纳入方案。”
“网上几千元就能装好。”“基础安装可以单独报价,资料治理、权限、IM 联调、三路验收和恢复保障分别列项。”
“能不能保证永远准确?”“用真实题库约定质量,答案带依据;金额和编号用确定性系统核对,专业判断由人员完成。”
“先把全部功能做好再付款。”“先做范围明确的收费试点,交付可使用系统和测试结论;生产范围与付款按采购流程另约。”

获客以可接触的企业名单、园区/行业协会、现有 IT 服务商、服务器供应商和案例转介绍为主。渠道合作写清线索归属、售前工时、交付与维护责任、渠道费和回款;不支付个人回扣,不拆分采购规避程序。

14 / DELIVERY BOUNDARIES

把影响能否交付的风险,提前放进方案

风险应对与边界
模型商用授权Qwen3.8 许可对 MaaS / AI Work Assistant 经营设有额外要求;内部使用例外不自动覆盖供应商销售整体助手。确认权利方书面授权,或选择许可清晰的基线模型。[2]
应用与 IM 许可Dify 的多租户、工作区、前端标识条件;Open WebUI 的品牌条件;IM 的认证、用户和移动推送授权都要检查。源代码能下载不等于任意去标转售。[18]
数据外发OCR、嵌入、重排、遥测、日志、备份、软件更新、移动推送逐项列数据流;严格隔离版验证断开外联后完整工作。
内部泄露服务端检索权限、缓存隔离、IM 私聊默认、频道可见范围、附件和引用重新鉴权,防止“提问者有权、群成员无权”。
提示注入与自动操作文档与聊天内容是资料,不是可信系统指令;机器人和工具最小权限,写回、发送与审批需明确授权及人工确认。
性能承诺失真相同三路输入输出测量;不引用单人速度保证三人,也不混淆 IM 在线与模型生成并发;复杂任务单列。
硬件与平台风险具体 SKU、来源、当地可交付条件与保修明确;二手和改装风险单列,消费卡机箱散热/机房要求核查,不因低价承诺服务器级保障。
知识质量与责任扫描件抽样、权威版本、过期标记、引用与人工复核;修复检索问题优先于盲目换大模型。
范围、维护和回款文档/接口/权限组/工时有边界;变更单执行;响应与修复分开,硬件直接采购,采购和验收路径先明确。
客户业务连续性IM 与 AI 分开升级;重要 IM 服务避免依赖单台实验机。单机不承诺高可用,恢复时间须经演练。

企业内部、公众服务和涉密系统,分别判断

政务项目先通过建设与数据准入判断。

内部应用的适用范围说明,不能代替政务领域的专门部署要求。请先核对G1 政务采购路径G4 数据边界;本方案的开源基线未逐一核实政务适用凭证,不直接作为任意部门自建批准依据。[41]

未向境内公众提供服务的内部应用,与公众生成式 AI 服务适用范围有区别;内部运行仍有网络、数据和个人信息保护责任。政务数据委托处理还需明确审批、处理权限、保护责任和监督,等保及其他测评按实际系统确定。[19][20]

商业秘密、工作秘密、国家秘密分别识别。涉密信息系统集成有专门资质条件;断网和本地部署不能替代资质,合作也不能成为无资质方接触涉密数据的途径。内部生成内容进一步公开发布时,按服务形态与发布渠道核对标识义务。[21][22]

本节是项目核查路径,不是针对具体客户的法律结论。保存实际交付模型、量化衍生版本、软件、插件和素材的许可证/NOTICE;准确说明自研与第三方部分。未知授权、特殊安全要求和测评费用单独确认。

15 / START SMALL, REPEAT WELL

先证明一个完整场景,再复制交付

最小资源组合

人员

创始人负责销售、需求与客户关系;一位负责本地推理、RAG、IM 接口及恢复的技术负责人;门户前端与业务集成可由另一位工程师/合作方支持;安全、法律财税和文档整理按项目合作。关键部署必须有第二人能接手。

设备与伙伴

优先使用已有 24GB 机器完成演示;48GB/96GB 设备通过供应商借测或短租验证。准备两家正规硬件服务商与一家本地 IT 合作方,明确保修和交付责任。

技术资产

两套硬件基线、一个主软件栈、两个模型候选;三路评测包、文档规则、IM 机器人、权限连接器、离线安装包、恢复与回滚手册。

商务基础

主体、对公收付款和开票能力;一页方案、资产盘点表、试点 SOW、报价边界、数据处理约定、验收与维护模板。资本安排以现金缓冲与少垫资为原则。

90 天路线

时间重点动作阶段结果
第 1–7 天选择有关系入口的一个行业,列 30 家名单;用公开资料搭 Zulip+知识助手演示,先验证已集成的最小功能一页方案、访谈邀请、三人演示与资料权限样例
第 8–14 天完成约 10 次访谈,挑 2 家资料与负责人明确的客户;试测 A/B 配置真实任务、可用资产、资料批准路径和收费试点方案
第 15–30 天签一个收费试点,约两周完成设备盘点、权限和三路测试首款、可试用系统、真实使用反馈、继续/停止结论
第 31–60 天按试点结论转生产,完善 IM、知识更新、备份和管理员培训生产合同、验收记录、恢复演练与经许可的案例
第 61–90 天复制到第二个同类客户;观察定制量与维护负担第二个付费客户、可重复安装包、真实工时与服务边界

共同底座尚未完成时,可以用 RAGFlow 的独立测试资料集加速公开资料演示,但不能把演示级隔离当成生产级逐人权限。同步完成门户/网关、授权与更新删除闭环,达到验收条件后再售卖相应标准功能;首次通用产品化投入属于公司研发,不由低价试点隐含承包。

推进条件:有重复任务、有资料授权、有负责验收的人、有预算和采购路径。多轮合格沟通后仍没有收费试点,应调整客群/场景;连续项目定制失控则先收窄产品;资金缓冲不足则暂停垫资与长期免费售前。

第一步,就做一个能演示三人协作的完整样例

一人问制度、一人查手册、一人整理资料,三路同时回答并能点击原文;再展示群聊权限、资料更新与审核入库。带着这个样例找三位真实负责人谈收费试点,再决定购置更大的机器。

已完成 0 / 5 项;这些选择仅在当前页面保留。

16 / FIRST DEAL TOOLKIT

首单工作模板

以下用于访谈和拟定范围。正式合同需补齐主体、含税价格、有效采购要求、付款、责任与争议条款;不能直接把未实测的性能写成保证。

一页客户提案:可直接带去沟通

项目:________ 部门内部 AI 协作与知识助手试点。

问题:________ 岗位在 ________ 流程里查资料耗时较长,资料位于 ________,现有工具的不足为 ________。

方案:优先使用现有设备,在批准网络内部署/接入内部 IM、企业知识库和本地 AI;最多 3 路同时生成,回答保留依据和权限。

路径:先评估,后进行约两周收费试点;通过客户题库、三路测试和实际使用反馈判断是否生产扩展。

费用:设备由客户/指定供应商采购;软件授权 ________;评估与试点服务 ________;含税总价 ________;生产扩展另按范围确认。

客户配合:批准资料、现有机器清单、业务负责人、IT 对接人及约定评测时间。

45 分钟访谈与设备盘点
  1. 一个具体任务如何完成?频率、耗时、结果怎样核对?
  2. 谁使用、谁验收、谁签约、谁付款、谁负责资料更新?
  3. “三人使用”的问题长度、输出长度和等待要求分别是什么?IM 有多少总用户?
  4. 资料类型、数量、页数、扫描比例、权威版本与权限怎样划分?
  5. 是否涉及国家秘密、工作秘密、个人信息或第三方版权?批准路径是什么?
  6. CPU/GPU 型号、可用 RAM、NUMA/PCIe、系统、虚拟化、磁盘健康和保修情况?
  7. 内网是否严格断网?需要移动推送、远程接入、音视频或单点登录吗?
  8. 预算是设备预算还是总项目预算?采购、准入和付款条件是什么?
  9. 怎样算成功?什么结果说明应停止投入?
  10. 下一次会议的日期、双方负责人和待办是什么?
试点 SOW:控制范围的示例

一个部门、最多 20 名试用账号(不是只有 3 个账号),最多 3 个同时生成请求;一个批准的文件来源、最多 200 份且合计不超过 2,000 页,扫描页不超过 10%;三个权限组、一个 IM 工作区/组织、一个私聊机器人、一个网页入口。

部署一个正式模型候选和一套本地检索链路;普通查询按 4k 输入、512 输出、关闭长思考测试,先约定目标再由实测确定承诺。IM 消息与知识资料的授权边界分别确认,群答默认关闭。

交付:盘点、适配、导入、原文引用、权限、三路测试、培训、结果报告。新增 IM 的测试账号可合并在上述账号范围内;生产 IM 规模和历史迁移另定。律所另确认案件级权限;政务试点先完成 G1/G4 的建设与数据准入,未获准时仅做公开或合成资料演示。

另计:超量资料、复杂扫描表格、多个业务接口、音视频、移动推送、商业授权、硬件、特殊安全测评、双机、驻场和微调。

起算条件:资料/访问条件/付款条件满足。试点不达标时按约定提交原因和修正选项,不默认升级为无限免费迭代。

验收记录与测试字段

每题记录:ID、用户角色、会话/频道、文档版本、问题类别、参考答案/原文、模型回答/引用、业务评分和失败原因。

每组性能记录:三请求同时起点、各自输入输出、有效首字、完成时间、是否有串行排队、量化与引擎版本、思考模式、冷热缓存、内存显存、错误率。三路+后台 OCR/索引/备份场景单测。

验收结论:通过 / 限定范围通过并附整改 / 未通过并约定复测。不要删除失败题提高成绩,新增场景与原范围缺陷分开处理。客户业务验收人签字 ________;IT 确认 ________。

生产交付、维护与迁移清单
  • 设备、系统、网络、端口、账户与权限清单。
  • 模型权重与软件版本/哈希、许可证/NOTICE、商业授权主体。
  • 离线安装、启动停止、升级回滚、IM 与 AI 分别维护步骤。
  • 知识导入更新删除、机器人权限、账号停用与群聊授权机制。
  • 质量、三路性能、外联、权限和恢复演练记录。
  • 备份计划、密钥归属、管理员培训,至少两名可接手人员。
  • 支持时段、工时、响应与修复区分,硬件与第三方责任分开。
  • 消息、附件、资料、索引/配置导出方式与结束服务后的迁移、返还和删除流程。
变更与数据处理约定

变更单:原范围 ________;新增需求 ________;对模型/三路性能/权限/工期的影响 ________;新增服务费与第三方费用 ________;双方确认 ________。

数据约定:合法来源、目的、范围、位置、期限、访问人员、转委托、日志保留、事件通报、结束返还与删除。覆盖 IM 消息、附件、文档、向量、缓存和支持包。

远程维护、外发诊断日志、案例宣传和跨客户复用资料分别取得适当授权。客户允许部署,不代表允许把资料用于训练、其他客户或公开演示。

17 / CUSTOMER CASES / 律所与政务部门

如果我是客户,我会怎样追问这套方案

八个模拟 Case,从业务问题一直追问到硬件、资料权限、验收、费用和退出方式。重点不是证明所有需求都能做,而是判断哪些值得进入收费试点。

阅读口径:这是方案推演,不是真实客户案例或运行测试。

客户规模、问题和示例输出均为虚构,不包含真实案卷或政务数据。“已覆盖”指 V3 已描述设计路径,不代表软件已经实现;“需补齐”指新增配置、开发或验证;“不承诺”指当前套餐不适合直接销售的能力。八个案例不是八套需要同时开发的产品。

模拟客户 / 核心需求现有方案能否回应建议成交方式
律所:找合同问题部分回应;RAG 问答不等于全合同审查P2+一种合同的专项规则;先小样本验证
律所:扫描案卷整理部分回应;需要页级证据、批处理和质量校验P3 候选;大量扫描另计解析治理
律所:跨团队保密权限方向已覆盖;案件级隔离仍需实现和验证P2+案件授权模块,不直接套部门权限
律所:旧机、预算、运维大部分已覆盖;替代设备和法律资料更新需明确P1 小范围起步或 P2;维护独立选购
政务部门:是否需要自建原方案不足;先检查上级资源及建设准入优先知识库治理+上级平台接入服务
政务部门:政策时效与口径版本路径已覆盖;需业务发布与适用条件管理批准环境内的 P2 应用能力,新增政策模板
政务部门:汇报材料与统计草稿可辅助;统计需确定性接口,不靠模型算范围固定的 P3 只读连接器或单项集成
政务部门:敏感材料 / 对外服务普通套餐不能直接承接,须分开评估缩小为批准资料的内部辅助,其他另立项目

先补上两类客户的进入条件

律所:业务授权比“文件能上传”更先一步

《律师法》第 23 条涉及利益冲突审查等制度,第 38 条规定执业保密义务。因此先由律所确认资料使用目的、案件授权与供应商接触范围,再建立知识库;安装在所内不能替代这些管理责任。[40]

政府部门:先核准建设路径

2025 年政务大模型指引强调统筹复用;县级及以下原则上复用上级资源,不再独立建设部署。通用问答、文书起草还需核查成熟且已备案的模型产品和服务。应防止国家秘密、工作秘密及敏感信息进入非涉密 AI。[41]

以下技术、合同和验收安排是本方案的工程建议,不是法规原文。政务项目按实际层级、平台要求及主管部门确认执行;不能用开源许可证代替备案、建设批准或数据使用批准。

CASE L1 · 律所 / 业务合伙人

“三位律师同时审合同,会不会漏掉关键条款?”

假设:一家 30 人律所,每天审查采购合同;三位律师同时处理不同客户的文件。先选 20 份获准使用的合同,其中 12 份调试、8 份盲测;盲测只用于初筛,不据此宣布行业准确率。

客户追问与我们的回答

问:能否上传一份 40 页合同,一分钟出完整审查意见?
答:不能按标准问答的 45 秒目标承诺。该目标仅用于三路各 4k 输入、512 输出;全合同应先解析全部条款,再按审查清单逐项处理、汇总交叉引用和遗漏项,作为异步任务单测。检索出的几个相关片段不足以证明全文审完。

问:能按我们代表买方的立场提出修改吗?
答:可以试做“原条款—所内规则—风险提示—建议改写—待律师判断”。需先收集经批准的买方审查规则、模板和例外;法律适用、谈判取舍及最终意见由律师确认。Word 修订模式导出不在现有门户描述内,要单列开发。

问:模型会不会编造法条?外部法律库能自动用吗?
答:只把已核验来源作为法律依据,显示名称、条号、版本和核验日期;缺依据时提示不足。法律库的离线复制、API 或批量使用需要相应授权,购买普通检索账号不自动取得这些权利。不上云可用批准的离线更新包;不能承诺本地模型记忆始终是最新法律。

虚构输出示例:“第 12.2 条约定的付款节点与附件二验收安排不一致。依据本所《采购合同审查清单》付款项提示核对;请确认是否采用分阶段验收。该提示不是对条款效力的结论。”点击可打开对应条款与规则版本。

如何搭配:P2 的 RTX A6000 48GB、16 核级 CPU、128GB RAM、2TB SSD 生成节点+旧应用服务器;vLLM、基线 35B 量化模型、底座 S,增加合同结构解析与规则任务。法律推理质量不达标时停止销售该场景,不能仅靠扩大显存证明有效。

是否覆盖:已有引用、版本与三路调度设计;需补全合同覆盖检查、条款关联、审查清单及改写确认。不能承诺“自动给出可直接签署的法律意见”。

验收与报价:律师先标注风险点和严重程度,分别记录高风险点召回、误报、引用支持及人工总耗时;关键漏检不能被平均分掩盖。性能同时测“三个短问题”和“短问题+合同任务”。建议沿用 ¥6,800–12,800 试点区间;P2 ¥39,800 起仅覆盖原标准范围,合同专项另估,不把从零开发藏进套餐价。

CASE L2 · 律所 / 诉讼团队负责人

“两千页案卷,能整理时间线并提醒关键期限吗?”

假设:一个非涉密民商事案件约 2,000 页,70% 为扫描件,夹有聊天截图和重复材料;只在获准的案件空间内处理。高扫描占比超出 P3 默认 30% 的范围,不能直接按标准价包干。

客户追问与我们的回答

问:能识别付款时间、证据编号和前后矛盾吗?
答:先输出“日期—事件—当事人主张/材料记载—出处—待核验项”,每项关联原文件、PDF 物理页与原页码。保留互相冲突的叙述,不把某方陈述自动当作事实,也不判定证据真实性。

问:手写签名、模糊金额能不能自动补齐?
答:识别不了就标记待复核,不补写。对关键金额、日期和主体名称安排逐项核对;低清、手写和复杂截图先用 100 页样本测解析质量及人工量。

问:能否自动计算最后起诉或上诉日期,直接设提醒?
答:当前套餐不能可靠承担该责任。模型可提取日期候选,但法律规则、起算事实及例外需要律师确认;如开发期限工具,应采用经审核规则与确定性日期计算、人工确认和独立提醒机制,另行验收。不能用生成的日期直接控制执业期限。

虚构输出示例:“材料 E-014 第 6 页记载付款日期为 4 月 12 日;E-022 第 2 页记载为 4 月 15 日。暂列两条记录,需核验原始凭证。扫描页中的金额识别不确定,未纳入合计。”

如何搭配:P3 保留 48GB 生成卡,增加 RTX 2000 Ada 16GB、64GB RAM、1TB SSD 解析节点;PaddleOCR+页级出处映射+事件表。先导入和校验,再开放查询;OCR 与长摘要是后台任务,在线三路有优先权。该小卡的入库速度须实测,不预设两千页当日完成。

是否覆盖:已有 OCR、版本、后台资源隔离设计;需补证据编号映射、事件去重、矛盾展示与关键字段确认。原始文件只读保留和 hash 用于内部追踪,不能把 hash 包装成已经完成司法存证。

验收与报价:样本记录页/小时、失败页率、关键字段正确率、可回溯比例、人工分钟/页,再外推工期并保留余量;全量入库后测三路问答。P3 ¥69,800 起之外,对超比例扫描治理及事件提取分别估价;期限管理不作为本次试点目标。

CASE L3 · 律所 / 管理合伙人及风控

“同一个所,不同团队能不能看到对方客户的材料?”

假设:同一部门有 A、B 两个案件团队,权限交叉且随人员加入、离职变化;“属于诉讼部”不足以决定可以看哪个案件。

客户追问与我们的回答

问:合伙人是不是默认能查全所资料?能限制到某个案件吗?
答:不默认拥有业务全文权限。建立“用户—案件—角色—有效期”授权,案件成员资格与资料等级共同判断,默认拒绝;技术管理员与业务查阅权分开。客户确认哪些管理岗位有例外及其审批记录。

问:把 A 案件链接发到 B 群,会不会泄露?
答:受控链接必须重新鉴权;文件名、搜索建议、结果数量及摘要也可能泄露,需一并限制。高敏内容不直接写入 IM 正文。撤权后的历史答案、导出任务及下载链接也要复核,已读或已复制的内容不能保证收回。

问:能帮我们自动做利益冲突审查吗?
答:案件隔离解决访问权限,不等于利益冲突审查。后者需单独维护客户、关联方、历史委托和主体别名,使用规则/精确匹配找候选,由风控人员作判断;“知识库没搜到”不能解释为“没有冲突”。这不在标准套餐内。

虚构输出示例:无权员工只看到“当前授权资料不足以回答”;系统不提示“已找到 A 客户秘密文件,但你无权查看”,也不泄露隐藏文件标题。

如何搭配:P2 硬件与底座 S,Keycloak 登录+应用案件授权表+数据库查询过滤+受控文件服务。共享模型实例不需要每案各放一个大模型;推理请求、缓存和审计必须隔离。要求物理隔离时另评存储/实例/节点和维护成本,不能只加一个案件标签。

是否覆盖:原方案已有 ACL、私聊和历史撤权原则;案件级继承、特权管理、旁路信息泄露用例需要新增。拥有系统 root 或数据库管理权的人仍可能访问数据,应用权限无法对其作绝对保密承诺。

验收与报价:构造两案、三种角色、人员转组/停用、直链、搜索、缓存、IM、备份恢复等至少 30 个对抗用例;约定用例出现泄露即阻断上线,不宣称绝对安全。案件模块按增量开发报价;避免将普通部门权限冒充已交付的案件隔离。

CASE L4 · 律所 / 主任、财务与 IT

“我们已有 3090 和服务器,花服务费到底买到了什么?”

假设:律所有一张 RTX 3090 24GB 和一台尚有 12 个可用 vCPU、64GB RAM 的服务器;设备能否合用仍需验证。首期只做获准模板和制度查询,不要求直接审复杂案件。

客户追问与我们的回答

问:是不是必须再买 48GB 显卡?三人同时问会卡吗?
答:先用 3090+9B 量化模型,检查主机 RAM、SSD、电源和显卡健康,软件放旧服务器以减少争用;按三路负载验收后决定。短问答达标就不换卡;法律复杂任务效果不够时,对比模型与人工成本,再决定是否进入 P2。

问:不给你们远程访问,出了问题怎么办?
答:由所内 IT 运行诊断,确认脱敏后提交版本、错误和容量信息;必要时在受控环境复现或约定到场。无远程权限时不能承诺自动发现故障。安装服务不意味供应商可读取全部案卷;开发调试优先使用合成数据。

问:断网以后法律怎么更新?不续费会停机吗?
答:律所知识负责人核验授权资料,我们按选购范围导入并复测;模型升级不等于法律库更新。停止维护可继续运行已交付版本,但补丁、巡检和内容更新不再自动包含。交付源码/脚本、数据导出、备份和密钥控制权,并移除供应商账号。

如何搭配:P1 的 llama.cpp+底座 S,推理主机优先补至 128GB RAM、2TB SSD;现有 IM 合适就接入,不强制迁移至 Zulip。旧应用服务器独立承载知识与身份;备份放独立介质。云 API 默认关闭,供应商不托管客户资料。

是否覆盖:硬件透明、维护工时、退出机制已覆盖;需核实设备清单、法律资料更新责任和 IM 接口。消费卡损坏没有备用 GPU 时,基础支持不保证当天恢复 AI;独立应用节点可继续搜索和查看原文。

验收与报价:按 P1 范围示例,¥19,800 实施+自选 ¥6,800 年维=¥26,600 首年服务预算,均未税,硬件不足项另列。展示调优前后三路表现、资料更新、撤权、一次恢复与交接;年维不是无限法律知识整理。要求 L1–L3 的专项能力时重新确定范围。

CASE G1 · 政府部门 / 采购负责人及信息中心

“县里已有统一大模型,我们能不能再买一台本地 AI?”

假设:某县部门 40 名工作人员,预计最多三人同时问答,上级已有电子政务外网模型平台;部门希望自己的资料可控、不进入互联网模型。

客户追问与我们的回答

问:本地是不是只能买设备放在办公室?
答:不是。应先按前述政务建设条件确认可用的上级平台、网络域、租户权限与资料处理规则;如可满足需求,我们提供部门知识治理和应用接入。未经确认,不直接销售独立 GPU 建设。

问:上级接口也是 API,资料不是仍然出去了吗?
答:是,离开部门服务器就是跨越了这一数据边界,即便不经过公网。要明确传出的提示词、历史和检索片段、接收平台、留存日志、运维权限及批准范围;“政务外网内”不等同于“部门单机内”,也不能归类为 L0 完全本地。

问:你们选的开源模型能直接用于政务吗?
答:不能只凭可商用许可证给出肯定结论。先由客户核对所需备案产品、具体服务形态和平台准入材料;本方案没有核实每一个 Qwen 权重或本地衍生部署的政务适用凭证。条件不满足时使用上级批准接口,或暂停该路线。

如何搭配:提出“政务平台接入版”作为交付路径,不新增一个固定模型套餐:获准的应用 VM 可先以 12 vCPU、64GB RAM、约 2TB 可用 SSD 验证;门户、身份适配、Haystack、PostgreSQL/pgvector 及本地检索组件按平台软件清单调整。生成调用上级模型,不购买部门 GPU;已有政务 IM/OA 优先复用。

是否覆盖:V3 的只读接口和权限架构可复用,但缺少上级模型适配、跨域数据清单、平台配额和统一管理要求。这里调整了原销售路径,不能把 P2 硬件清单直接视为政务采购建议。

验收与报价:同时触发三路,分别记录本地检索耗时、上级排队及生成耗时;部门限流为 3 不代表共享平台一定供给 3 路。共享资源繁忙的超时/失败策略写进验收。按资料治理、应用部署、平台接口、安全验证分别报价,复用模块扣除工作量;平台服务费用由客户确认,不照收一套本地模型调优费。

CASE G2 · 政府部门 / 窗口负责人及业务科室

“新旧政策冲突时,助手会不会给出错误办事口径?”

假设:某市部门内部窗口助手使用 300 份已批准资料,包含旧指南、现行指南和内部经审核 FAQ;不是直接面向群众的无人咨询机器人。部署环境先通过 G1 的条件确认。

客户追问与我们的回答

问:2025 年和 2026 年两版补贴指南都在库里,选哪版?
答:先询问申请年度、办理地区和事项;元数据记录有效期、适用对象、文号和替代关系,按业务科室确认的规则检索。文件上传较晚不等于法律效力较新;发现无法解释的冲突时列出差异并转人工。

问:今天调整材料清单,什么时候能答新口径?
答:由知识责任人审核发布;先测同步发现、解析、审核、切换各段时间,再约定总时延。紧急废止先阻断旧版使用,不能等待新文件解析结束才撤旧;新口径未通过时显示“待业务确认”。

问:可不可以根据申请人的情况直接决定能否领补贴?
答:当前只展示所需条件、缺失信息及出处,辅助经办人核对;不自动作出资格认定或行政决定。涉及个人材料的处理资格与边界另外确认,不能因指南已入库就扩展为个人审批系统。

虚构输出示例:“请先确认办理地区和申请年度。目前批准库中有两份适用期间不同的指南;尚不足以给出材料清单。确认后将列出对应条款和附件页码。”不编造具体政策或补贴金额。

如何搭配:采用 P2 应用能力+政策版本/适用条件字段+审核发布,模型通过获准平台或经批准的本地节点提供。内部 IM 只作入口,原文走受控门户;公网搜索和互联网模型默认不启用。政务平台调用的数据流按 G1 单列。

是否覆盖:已有版本、冲突和无依据处理设计;需补政策适用条件、紧急停用、负责人审核和固定答复模板。更大模型不能替代正确的政策台账。

验收与报价:按 200 题规划,例如现行政策 80、历史/跨地区 40、条件缺失 40、过期/无依据 40;按类别划分调试与盲测,不全部用于调参。业务科室签认现行口径,单独检查错误适用和过期引用;通用 85% 目标不能自动成为此类业务的安全门槛。按批准的应用范围加政策治理报价,不额外包装为“训练 300 份文件”。

CASE G3 · 政府部门 / 综合科及统计经办人

“能不能自动写月报,并保证里面的数字准确?”

假设:部门需汇总已经批准可处理的非敏感事项统计;一人查公开政策,一人查询只读统计视图,一人生成月报草稿。底层建设与数据权限已另行确认。

客户追问与我们的回答

问:直接把几十张 Excel 丢进去,能算本月办件数吗?
答:先确定统计口径、去重键、撤销件处理、时间范围及截止点;用 SQL/确定性程序对批准视图计算,模型解释结果。来源为旧 Excel 时只能称该快照统计,不能称实时数据。

问:能套用去年月报格式、自动形成领导讲话吗?
答:可以按批准模板形成草稿,事实和数字带来源,未知项保留待补字段;不能沿用去年数字冒充今年。输出文件格式、表格及模板复杂度要事先约定;精确 Word 排版另做适配。

问:生成后能否自动盖章、发到 OA 或公众平台?
答:当前方案不包含自动盖章与对外发布。只输出待复核草稿,由经办人和审批人按既有流程处理;OA 写回也属于新增权限和接口,不因有只读连接器就自动开放。

虚构输出示例:“统计期间:模拟月份;口径:受理日期、剔除撤销件、按事项编号去重;结果由已批准查询返回。某项同比缺少可比基期,显示‘暂不计算’,不自行补数。”

如何搭配:P3 应用范围中的一个固定只读接口+字段白名单+结果核对;身份映射到用户可查询范围。只做文字/结构化数据时可不买额外 OCR 卡,按实际拆减硬件;生成采用 G1 获准模型路径。后台长月报不能占满交互名额。

是否覆盖:已有确定性数据和只读集成方向;需补统计口径版本、数据快照时间、模板字段与审批导出。不能承诺全自动完成正式公文或自主决定政策。

验收与报价:为约定的 20 组查询建立人工核准结果,数字、单位、期间及去重口径逐项一致;故意断开数据库后应提示不可用,不使用模型猜数或偷偷切云。一个符合 P3 边界的接口不重复计价,新增 OA 写回、额外视图/口径和复杂文档导出另估。

CASE G4 · 政府部门 / 保密、网安及运维负责人

“完全断网,就能放所有内部材料并对外提供服务吗?”

假设:一个部门同时提出公开指南问答、未公开工作材料整理及未来群众咨询三个诉求;其中部分文件可能含国家秘密、工作秘密或敏感信息。先分类并拆分范围,不能作为一套普通知识库打包实施。

客户追问与我们的回答

问:既然断网,能直接导入这些文件吗?
答:不能仅以断网作为批准条件。先由客户保密及业务负责人确认资料性质与可处理范围;未明确的文件不导入本方案的普通非涉密 AI。涉密建设和敏感信息处理需要另行确定适用环境与准入,不能通过购买 P3 或签保密协议自动满足。

问:供应商能保证既不看数据又远程修复全部故障吗?
答:不能作这样的双重承诺。能用合成样本和脱敏诊断解决的先离线处理;必须接触业务环境时按批准人员、范围、时限执行。客户掌握密钥与备份,禁止默认外联隧道。某些故障只能到场或由本单位管理员操作,SLA 应反映这一条件。

问:内部稳定后,能把网页直接开放给群众吗?
答:不直接开放。那会改变用户规模、内容责任、攻击面和数据边界,应分离公开知识源、身份入口及服务环境,另做内容审核、适用义务核查与容量设计;三路内部模型不等于公众服务能力。不得把内部资料问答接口暴露到互联网。

如何搭配:首期仅处理经批准的资料,在获准环境复用身份、IM、知识服务与监控。严格隔离模式用受控介质导入镜像/模型/更新包,登录、OCR、检索、备份都验证无外联;L0 本身只是运行方式,不是安全资质或涉密等级。

是否覆盖:原方案已涉及数据、远程维护与公众服务边界;本 Case 把它变成明确停止条件:数据分类不明、环境未批准或要求普通套餐承接涉密数据时,不进入导入和生产承诺。

验收与报价:由客户安全人员核验准入与数据清单,做冷启动断网运行、越权拒绝、脱敏诊断及备份恢复;恢复后先重新应用删除/撤权记录。现场服务、特殊测评及备用环境另列;“1 个服务小时响应”不代表“1 小时到场修复”。群众服务扩展重新立项,不是免费开放端口。

八个 Case 暴露出的产品缺口,怎样排优先级

优先级 / 缺口应新增的可审查交付物成交影响
首要 · 政务建设与数据准入层级/上级资源盘点、模型适用凭证、批准数据范围及实际数据流图先决定能否做、在哪做,再报 GPU 或平台接入价
首要 · 案件 / 项目权限案件授权矩阵、特权账号规则、撤权与旁路泄露测试包跨团队律所不能拿部门权限原型直接签生产
首要 · 行业效果评测合同关键漏检、案卷关键字段、政策适用错误、统计精确值的分项题库通用可用率之外,写清高风险错误的上线阻断条件
下一阶段 · 长文档与可追溯结果全文处理覆盖记录、页码与条款映射、任务进度、失败重试、人工确认按专项范围收费;长任务与三路短问答分开承诺
下一阶段 · 法律 / 政策更新来源许可、有效期/适用范围台账、审核人、紧急撤版及更新记录把内容治理与软件维护分开,不承诺免费永久更新
暂缓扩展自动期限管理、利益冲突工具、盖章/写回、公众服务各自的独立方案没有明确业务责任人与预算就不加入第一版

销售演练:最后让客户决定什么

律所的首单建议

优先 L4 的所内模板查询,或将 L1 缩小为一种合同的辅助检查。由管理合伙人确认数据与预算、业务律师定义质量、IT 确认资产及维护条件。先提交获准样本、案件权限和一份有限范围试点书;不以“全所 AI 律师”签总包。

政府部门的首单建议

先完成 G1 的路径确认,再做 G2 的批准指南检索;业务科室、信息中心和相关安全负责人共同确认来源与准入,采购部门确认可行流程。上级模型可用时,首单卖知识治理和接口交付,避免为了卖设备推动重复建设。

共同的继续条件:客户愿意提供获准资料与验收人;盲测结果能改善实际任务;三路负载、权限与恢复通过约定测试;报价覆盖新增工作。否则缩小范围或提交不适配结论。保留失败记录,不把本章的模拟回答作为实测通过证明。

18 / SOURCES & ASSUMPTIONS

研究依据与尚待确认事项

优先采用模型方、推理引擎、软件厂商和监管机构原文。公开作者的硬件实验仅用于说明可行性。本文没有为三路并发进行现场硬件测试,也未取得当日含税供货报价;客户设备、IM 规模、业务题库与授权决定最终方案。

  1. Qwen3.8-Flash-Next 官方模型卡 — 架构、参数与上下文;能力榜单不等于量化后的客户效果。
  2. Qwen3.8 商业许可证 — MaaS / AI Work Assistant 与内部使用条件。
  3. vLLM Qwen3.8 配方llama.cpp 上游支持 — 部署与版本支持。
  4. vLLM Qwen3.5-35B-A3B 配方27B 模型卡35B 模型卡9B 模型卡 — 基线候选与实际许可证。
  5. 双 RTX 3090 作者原始实验 — 特定单流测速与限制,不能外推为三路指标。
  6. RTX PRO 6000 96GB 作者部署仓库 — 专项量化/卸载与补丁路线。
  7. NVIDIA RTX 5090 D v2 规格 — 精确 SKU 的显存与互联。
  8. DGX Spark 官方规格Mac Studio 中国购买页 — 当前配置和供应需重新询价。
  9. RTX A6000 官方规格 — 48GB 显存示例。
  10. Zulip 主仓库部署要求 — IM 选型和资源边界。
  11. Mattermost 版本与产品定位 — 按工作负载核查适用版本。
  12. Zulip 移动推送说明 — 外部依赖、计划、加密与元数据。
  13. RAGFlow 主仓库许可证 — 文档处理候选。
  14. Qwen3 EmbeddingQwen3 Reranker — 本地检索组件。
  15. Qdrant 过滤安全说明 — 过滤能力不替代应用授权。
  16. KTransformers 主仓库 — 异构推理支持需核对实际架构。
  17. vLLM 服务压测工具说明(版本化文档) — 并发、首字与完成时间的测量;生产按实际版本使用参数。
  18. Dify LICENSEOpen WebUI LICENSE — 集成与品牌条件。
  19. 生成式人工智能服务管理暂行办法 — 内部与公众服务的范围区分。
  20. 网络数据安全管理条例 — 委托处理及政务数据责任。
  21. 涉密信息系统集成资质管理办法 — 涉密集成边界。
  22. 人工智能生成合成内容标识办法 — 公开传播时的适用义务。
  23. RTX A5000 24GB 官方规格 — 专业卡具体型号示例。
  24. AMD Ryzen 9 7900 / 7950X 官方资料 — CPU 示例;核数不代表完整应用性能。 7900 官方支持页
  25. RTX 6000 Ada 官方规格 — 48GB 另一代产品,不能与 A6000 同一测速处理。
  26. Qwen3.5-35B-A3B 官方 GPTQ-Int4 权重 — 量化模型候选;另核对 vLLM 量化兼容文档
  27. RTX 2000 Ada 官方介绍 — 16GB 小卡作为独立解析/检索资源候选。
  28. RTX PRO 6000 Blackwell 系列 — 96GB 专项配置示例;实际供货与采购条件另核实。
  29. llama.cpp MIT 许可证 — 推理引擎;另见 vLLM Apache-2.0 主仓库
  30. Vue 3 MIT 说明 — 门户框架;FastAPI MIT 许可证
  31. Haystack 核心许可证与项目 — Apache-2.0;向量检索关键词检索提供组合基础,不代替应用授权。
  32. PostgreSQL 许可证 — 数据库许可;pgvector 项目与过滤/检索说明
  33. jieba 中文分词项目 — MIT,支持自定义词典;需配合业务语料测试。
  34. PaddleOCR 许可证 — 主项目 Apache-2.0;具体模型与依赖分别审查。
  35. Keycloak 主仓库 — Apache-2.0;另见 Zulip 认证方式
  36. Valkey 项目与许可 — BSD-3-Clause;PrometheusAlertmanager 为 Apache-2.0。
  37. restic 主仓库与许可 — 文件备份;pgBackRest 为 MIT 的数据库备份工具。
  38. LibreChat MIT 许可证 — 聊天界面候选,运行依赖需单独核查。
  39. Haystack 遥测说明 — 部署时按冻结版本关闭并进行外联验证。
  40. 《中华人民共和国律师法》官方全文 — 第 23、38 条:律所制度与执业保密;2026-09-05 核对。
  41. 《政务领域人工智能大模型部署应用指引》官方全文 — 2025 年发布,核对实施路径、统筹部署与保密要求;2026-09-05 查阅。具体工程安排为本方案建议。