基于Dify认识RAG Pipeline:文档入库、异步索引与检索闭环

以 Dify 可编排知识流水线为例,介绍数据源、解析、清洗、分块、Embedding、索引和检索的完整生命周期,以及异步状态和版本变更的工程设计。

大模型

文本分割器(Text Splitters)选型与应用指南

从边界依据出发,系统介绍固定大小、语义、递归、结构和 LLM 五类文本分块方法的实现逻辑、适用场景与评测方式。

大模型

生产级 RAG 文档入库设计:解析、清洗、分块与 Embedding 工程化

聚焦生产级 RAG 的文档入库链路,设计 MinerU、MarkItDown 与内置解析器的路由,清洗 Pipeline、结构化分块,以及 Embedding 的批处理、并发、限流和版本发布。

大模型