Chapter 71
llm summarize
处理流程:
- 对表格或者文章文档切分成chunk,将其存入DB
- 根据chunk文档内容,通过prompt生成问题(qwen)
- 通过sentencetransformer生成embbedding(Text embedding 模型 stella_large 模型,长文本编码), 第二步 抽取的问题 和 文档 进行相似度匹配,过滤掉阈值小于0.5的问题和文档对
- 选择正负样本,一个正样本,15个负样本
- 扩展bert长度从512到1024,使用层次分解的位置编码进行初始化(bge-large)
- 模型训练(bge)
- 校验模型获取到 query 与 文档chunk 前三的文档及其分数 ,以及query对应的标准答案
- 计算rouge指标
