Appearance
解析、分段与清洗
上传成功只表示源文件已经进入处理流程。检索质量主要由解析结果、切片边界和清洗规则决定。
解析模型
根据资料类型选择文本解析、OCR 或视觉能力。复杂表格、图片说明和扫描件需要抽查版面还原,不能只看处理状态。
切分模式
- 按标题或段落切分,适合结构清晰的文档。
- 按固定长度切分,适合结构较弱的长文本。
- FAQ 和表格应使用与其数据结构匹配的模式。
- 适当重叠可保留上下文,但过大重叠会增加重复召回。
清洗重点
清理乱码、空段、重复内容、页眉页脚和无意义符号,同时保留型号、编号、单位、标题和表头。过度清洗可能破坏专业术语和引用上下文。
处理后检查
- 查看文件状态和失败原因。
- 抽查开头、中间、结尾和复杂表格区域。
- 确认切片能够独立回答一个明确问题。
- 检查标题和来源信息是否保留。
- 效果不佳时重新分段,而不是直接上线。
重新处理会改变检索片段,应保留旧参数和测试结果,避免无法解释效果变化。