From 3ca1cefd9bed863131ee3f684ff127bd7ac877aa Mon Sep 17 00:00:00 2001
From: 云 <2163098428@qq.com>
Date: 星期三, 05 八月 2026 11:35:16 +0800
Subject: [PATCH] feat(ai): 优化AI知识文档处理功能

---
 yudao-module-ai/src/main/java/cn/iocoder/yudao/module/ai/service/knowledge/AiKnowledgeDocumentServiceImpl.java |   62 ++++++++++++++++++++++++++++--
 1 files changed, 57 insertions(+), 5 deletions(-)

diff --git a/yudao-module-ai/src/main/java/cn/iocoder/yudao/module/ai/service/knowledge/AiKnowledgeDocumentServiceImpl.java b/yudao-module-ai/src/main/java/cn/iocoder/yudao/module/ai/service/knowledge/AiKnowledgeDocumentServiceImpl.java
index c11c264..5f671a2 100644
--- a/yudao-module-ai/src/main/java/cn/iocoder/yudao/module/ai/service/knowledge/AiKnowledgeDocumentServiceImpl.java
+++ b/yudao-module-ai/src/main/java/cn/iocoder/yudao/module/ai/service/knowledge/AiKnowledgeDocumentServiceImpl.java
@@ -28,6 +28,10 @@
 import org.apache.tika.parser.Parser;
 import org.apache.tika.extractor.EmbeddedDocumentExtractor;
 import org.apache.tika.sax.BodyContentHandler;
+import org.apache.poi.xwpf.extractor.XWPFWordExtractor;
+import org.apache.poi.xwpf.usermodel.XWPFDocument;
+import org.apache.poi.hwpf.HWPFDocument;
+import org.apache.poi.hwpf.extractor.WordExtractor;
 import org.xml.sax.ContentHandler;
 import java.io.ByteArrayOutputStream;
 import java.io.InputStream;
@@ -57,6 +61,8 @@
     private AiKnowledgeSegmentService segmentService;
     @Resource
     private AiModelService modelService;
+    @Resource
+    private cn.iocoder.yudao.module.system.service.storage.SystemStorageBlobService storageBlobService;
 
     @Override
     @Transactional(rollbackFor = Exception.class)
@@ -113,11 +119,28 @@
         }
     }
 
+    /**
+     * 浠� storage-blob URL 瑙f瀽鍑� fileName 鍜� token
+     */
+    private static java.util.regex.Pattern STORAGE_URL_PATTERN =
+            java.util.regex.Pattern.compile("/storage-blob/(?:preview|download)/([^?]+)\\?.*token=([^&]+)");
+
     private byte[] downloadFile(String fileUrl) {
+        // 浼樺厛閫氳繃 storage-blob 鏈湴璇诲彇锛岄伩鍏� HTTP 璁よ瘉闂
+        var matcher = STORAGE_URL_PATTERN.matcher(fileUrl);
+        if (matcher.find()) {
+            String fileName = matcher.group(1);
+            String token = matcher.group(2);
+            try {
+                java.io.File file = storageBlobService.getFileByToken(fileName, token);
+                return java.nio.file.Files.readAllBytes(file.toPath());
+            } catch (Exception e) {
+                log.warn("鏈湴璇诲彇瀛樺偍鏂囦欢澶辫触锛屽洖閫� HTTP 涓嬭浇: {}", e.getMessage());
+            }
+        }
+        // 鍥為�� HTTP 涓嬭浇
         try {
-            // 鎵嬪姩缂栫爜 URL 璺緞涓殑闈� ASCII 瀛楃锛岄伩鍏� URI 鏋勯�犲嚱鏁版姤閿�
-            String encodedUrl = encodeUrlPath(fileUrl);
-            URL url = URL.of(new URI(encodedUrl), null);
+            URL url = URL.of(new URI(encodeUrlPath(fileUrl)), null);
             HttpURLConnection conn = (HttpURLConnection) url.openConnection();
             conn.setConnectTimeout(30000);
             conn.setReadTimeout(60000);
@@ -184,7 +207,36 @@
             if (ArrayUtil.contains(new String[]{"txt", "md", "json", "xml", "csv", "yaml", "yml"}, ext)) {
                 return new String(fileBytes, StandardCharsets.UTF_8);
             }
-            // 浣跨敤 AutoDetectParser + EmbeddedDocumentExtractor 璺宠繃宓屽叆鍥剧墖锛岄伩鍏嶆彁鍙栧埌浜岃繘鍒朵贡鐮�
+            // .docx 浼樺厛浣跨敤 POI 鎻愬彇锛屼腑鏂囨敮鎸佹洿濂�
+            if ("docx".equals(ext)) {
+                try (XWPFDocument doc = new XWPFDocument(new java.io.ByteArrayInputStream(fileBytes));
+                     XWPFWordExtractor extractor = new XWPFWordExtractor(doc)) {
+                    String text = extractor.getText();
+                    if (StrUtil.isNotEmpty(text)) return text.trim();
+                } catch (Exception e) {
+                    log.warn("POI 瑙f瀽 docx 澶辫触锛屽洖閫� Tika: {}", e.getMessage());
+                }
+            }
+            // .doc 浼樺厛浣跨敤 POI 鎻愬彇
+            if ("doc".equals(ext)) {
+                try (HWPFDocument doc = new HWPFDocument(new java.io.ByteArrayInputStream(fileBytes));
+                     WordExtractor extractor = new WordExtractor(doc)) {
+                    String text = extractor.getText();
+                    if (StrUtil.isNotEmpty(text)) return text.trim();
+                } catch (Exception e) {
+                    log.warn("POI 瑙f瀽 doc 澶辫触锛屽洖閫� Tika: {}", e.getMessage());
+                }
+            }
+            // 鍏朵粬鏍煎紡鎴� POI 澶辫触鏃跺洖閫� Tika
+            return extractTextWithTika(fileBytes);
+        } catch (Exception e) {
+            log.warn("鏂囨。鍐呭鎻愬彇澶辫触锛屽皾璇� UTF-8 鏂囨湰璇诲彇: {}", e.getMessage());
+            return "";
+        }
+    }
+
+    private String extractTextWithTika(byte[] fileBytes) {
+        try {
             Parser parser = new AutoDetectParser();
             ParseContext context = new ParseContext();
             context.set(EmbeddedDocumentExtractor.class, new EmbeddedDocumentExtractor() {
@@ -203,7 +255,7 @@
             }
             return handler.toString().trim();
         } catch (Exception e) {
-            log.warn("Tika 瑙f瀽鏂囨。澶辫触锛屽皾璇� UTF-8 鏂囨湰璇诲彇: {}", e.getMessage());
+            log.warn("Tika 瑙f瀽澶辫触: {}", e.getMessage());
             return "";
         }
     }

--
Gitblit v1.9.3