杠精派
派聪明
0/512

热门评论

玄英 2026年06月24日 17:21
@派聪明 文件解析的时候会在mysql中也存一次文本数据吗?
点赞
回复9 取消回复
派聪明 2026年06月24日 17:21
根据提供的参考资料,**是的,文件解析时MySQL中也会存储文本数据**。 在数据库设计的**解析结果表(`document_vectors`)**中,有一个 `text_content` 字段(`TEXT` 类型),专门用于存储解析后提取的**文本分块内容**。表的定义如下: ```sql CREATE TABLE document_vectors ( vector_id BIGINT AUTO_INCREMENT PRIMARY KEY, file_md5 VARCHAR(32) NOT NULL, chunk_id INT NOT NULL, text_content TEXT COMMENT '文本内容', -- 这里存储文本数据 model_version VARCHAR(32), user_id VARCHAR(64) NOT NULL, org_tag VARCHAR(50), is_public BOOLEAN NOT NULL DEFAULT FALSE ); ``` 此外,参考资料中提到,**Elasticsearch** 也会存储原始文本内容和向量数据。也就是说,文本数据实际上是**双存储**的: - **MySQL**:存储文本分块内容,用于元数据管理和快速查询 - **Elasticsearch**:同时存储原始文本和向量数据,用于后续的向量检索 两者的定位不同:MySQL 偏向**记录与状态管理**,ES 偏向**搜索与向量匹配**。
点赞
回复 取消回复
展开剩余 8 条回复

158 条评论

文艺的灯泡 2026年08月20日 21:05
@杠精派 如果redis宕机,断点续传状态怎么恢复?
点赞
回复1 取消回复
杠精派 2026年08月20日 21:05
如果redis宕机,断点续传状态怎么恢复! 当前模型还在开发当中,请右上角下拉框切换到其他模型
点赞
回复 取消回复
文艺的灯泡 2026年08月20日 21:04
@派聪明 如果redis宕机,断点续传状态怎么恢复?
点赞
回复1 取消回复
派聪明 2026年08月20日 21:04
如果redis宕机,断点续传状态怎么恢复! 当前模型还在开发当中,请右上角下拉框切换到其他模型
点赞
回复 取消回复
呓语 2026年08月16日 15:41
@杠精派 @派聪明 GB级文件从10秒降低到3秒怎么做到的?文件上传是异步的吗?
点赞
回复3 取消回复
杠精派 2026年08月16日 15:41
@派聪明 GB级文件从10秒降低到3秒怎么做到的!文件上传是异步的! 当前模型还在开发当中,请右上角下拉框切换到其他模型
点赞
回复 取消回复
展开剩余 2 条回复
呓语 2026年08月16日 15:41
@派聪明 GB级文件从10秒降低到3秒怎么做到的?文件上传是异步的吗?
点赞
回复1 取消回复
派聪明 2026年08月16日 15:41
GB级文件从10秒降低到3秒怎么做到的!文件上传是异步的! 当前模型还在开发当中,请右上角下拉框切换到其他模型
点赞
回复 取消回复
嘿嘿 2026年08月14日 17:25
引用原文:03.文档处理流程(合并解析和向量化)
sequenceDiagram participant KafkaBroker participant FileProcessingConsumer participant MinIO participant ApacheTika participant MySQL participant EmbeddingAPI participant Elasticsearch KafkaBroker->>FileProcessingConsumer: 接收任务 (MD5, 路径, 文件名) FileProcessingConsumer->>MinIO: 下载文件 MinIO-->>FileProcessingConsumer: 返回内容 FileProcessingConsumer->>ApacheTika: 提取文本 ApacheTika-->>FileProcessingConsumer: 返回文本 FileProcessingConsumer->>MySQL: 存储分块文本 MySQL-->>FileProcessingConsumer: 存储成功 FileProcessingConsumer->>MySQL: 获取分块内容 MySQL-->>FileProcessingConsumer: 返回分块 FileProcessingConsumer->>EmbeddingAPI: 生成向量 EmbeddingAPI-->>FileProcessingConsumer: 返回向量 FileProcessingConsumer->>Elasticsearch: 存储文本+向量(建索引) Elasticsearch-->>FileProcessingConsumer: 存储成功 FileProcessingConsumer->>KafkaBroker: 记录完成状态
点赞
回复 取消回复
嘿嘿 2026年08月14日 17:23
引用原文:.文档处理流程(合并解析和向量化)
@杠精派 @派聪明 存储过程是什么呢?数据库存储的其实是原数据,而ES存储的是索引,是一个向量,所以删除的时候要把向量删除吗?还是什么
点赞
回复1 取消回复
杠精派 2026年08月14日 17:23
请围绕下面这段划线内容回复:".文档处理流程(合并解析和向量化)" 存储过程是什么呢!数据库存储的其实是原数据,而ES存储的是索引,是一个向量,所以删除的时候要把向量删除!还是什么 当前模型还在开发当中,请右上角下拉框切换到其他模型
点赞
回复 取消回复
嘿嘿 2026年08月14日 17:23
引用原文:.文档处理流程(合并解析和向量化)
@派聪明 存储过程是什么呢?数据库存储的其实是原数据,而ES存储的是索引,是一个向量,所以删除的时候要把向量删除吗?还是什么
点赞
回复1 取消回复
派聪明 2026年08月14日 17:23
这是我从文章中选择的一段文本:".文档处理流程(合并解析和向量化)" 存储过程是什么呢!数据库存储的其实是原数据,而ES存储的是索引,是一个向量,所以删除的时候要把向量删除!还是什么 当前模型还在开发当中,请右上角下拉框切换到其他模型
点赞
回复 取消回复
贪玩的月亮 2026年08月14日 12:13
引用原文:模块支持多种文档格式(PDF、Word、Excel)
@派聪明 如果文档有表格怎么处理,表格跨页怎么处理,pdf跨页,pdf纵向等各种情况该怎么处理
点赞
回复3 取消回复
派聪明 2026年08月14日 12:13
这是我从文章中选择的一段文本:"模块支持多种文档格式(PDF、Word、Excel)" 如果文档有表格怎么处理,表格跨页怎么处理,pdf跨页,pdf纵向等各种情况该怎么处理 当前模型还在开发当中,请右上角下拉框切换到其他模型
点赞
回复 取消回复
展开剩余 2 条回复
2026年08月09日 17:03
@派聪明 如果上传所有分片后,发现有一个失败了怎么办
点赞
回复1 取消回复
派聪明 2026年08月09日 17:04
如果上传所有分片后,发现有一个失败了怎么办 当前模型还在开发当中,请右上角下拉框切换到其他模型
点赞
回复 取消回复
上官语然 2026年08月08日 09:36
@派聪明 1:前端发起上传请求,获取分片策略是哪个接口,看到的是文件分片上传接口了。 2:删除文档接口为什么不删除chunk_info分片信息呢,是处于什么考虑吗?目前删除文档后再次上传该文档无法合并,需要手动清chunk_info信息
点赞
回复1 取消回复
派聪明 2026年08月08日 09:36
1:前端发起上传请求,获取分片策略是哪个接口,看到的是文件分片上传接口了。 2:删除文档接口为什么不删除chunk_info分片信息呢,是处于什么考虑!目前删除文档后再次上传该文档无法合并,需要手动清chunk_info信息 当前模型还在开发当中,请右上角下拉框切换到其他模型
点赞
回复 取消回复

目录