ESSAYS & NOTES
不追逐日更,只记录值得反复思考的事。
在设备、文档、属性和规范高度关联的场景里,图谱能补足纯向量检索难以表达的关系约束。
元数据回答“数据是什么”,本体回答“对象如何关联”;二者共同连接数字化交付、治理与智能应用。
文件进入知识库的第一分钟,决定了后续检索、更新和审计是否会失控。
企业 AI 的差异不只在模型能力,而在身份、权限、文件隔离、任务恢复和可观测性这些运行时能力。
把文档任务拆为受控的子能力,才能让 Agent 可靠地检索、抽取、比较和生成。
PDF、扫描件、Office 文件、CAD 图纸不能共用一套万能解析器;正确做法是识别特征后路由。
模型、索引和提示词只是起点;部署、观测、评测与降级策略决定 RAG 能否在真实环境长期运行。
Agent 的价值不在于“会思考”,而在于能在权限、工具、状态与验证约束下完成多步骤任务。
知识平台的核心不是聊天窗口,而是把文件、对象、规则、检索和人工确认组织成闭环。
AI 可以发现字段缺失与名称不一致,但合格的校验系统必须给出规则、证据、置信度和复核入口。
按固定字数切块很方便,却常把章节、表格和结论切碎;更可靠的是结构优先、语义补充的分块策略。
准确回答既依赖向量相似度,也依赖位号、文件名、全文索引和结构化查询。
表格型资料进入知识库前,需要完成模板识别、字段标准化、异步处理与多存储协同。
面对扫描件、PDF、Excel 与 Word,可靠的解析不是一次 OCR,而是一条能保留证据的结构恢复链路。