上下文整理

支持1M上下文 · 多领域智能分类 · 结构化数据提取 · 高性能并行处理

测试日期: 2026-07-09 | 版本: v1.0

📝
8
预定义领域类别
3,124
字符/秒处理速度
🔍
9
数据提取模式
🧩
77K
Token处理能力

🏗️ 引擎架构

┌──────────────────────────────────────────────────────────┐ │ 输入层 (Input) │ │ 📄 文件导入 🌐 API输入 📋 文本粘贴 │ └──────────────────────┬───────────────────────────────────┘ ▼ ┌──────────────────────────────────────────────────────────┐ │ 预处理层 (Preprocessing) │ │ ✂️ 智能分块 🧹 文本清洗 🔢 Token估算 │ └──────────────────────┬───────────────────────────────────┘ ▼ ┌──────────────────────────────────────────────────────────┐ │ 语义分析层 (Semantic Analysis) │ │ 📊 TF-IDF向量化 🎯 关键词匹配 🧲 语义相似度 │ └──────────────────────┬───────────────────────────────────┘ ┌───────────┴───────────┐ ▼ ▼ ┌──────────────────┐ ┌──────────────────┐ │ 分类决策层 │ │ 数据提取层 │ │ 🏷️ 规则匹配 │ │ 👤 人名识别 │ │ 🤖 ML分类器 │ │ 📅 日期提取 │ │ 🧠 LLM辅助(可选)│ │ 💰 金额提取 │ └────────┬─────────┘ │ 📧 联系方式 │ │ │ 📝 关键句摘要 │ │ └────────┬─────────┘ └───────────┬───────────┘ ▼ ┌──────────────────────────────────────────────────────────┐ │ 输出层 (Output) │ │ 📊 JSON结果 📑 Excel报表 🎨 可视化图表 │ └──────────────────────────────────────────────────────────┘

🧪 测试1:多领域混合文本 通过

输入:包含科技、金融、教育、医疗4个领域的混合文本(607字符 / ~746 tokens)

607
输入字符
~746
估算Token
24
发现实体
13
模式匹配

📂 分类结果

教育/学术
100.0%
1块 · 0.38

⚠️ 由于文本较短被合并为1个块,混合内容中教育类关键词占比最高。实际使用中建议调小chunk_size以获得更细粒度分类。

🔍 提取实体

👤 余承东 👤 明明 👤 李奕 👤 吴尊友 📅 2024年7月15日 📅 7月14日 💰 5999元 💰 7999元 💰 5000亿元 📊 300% 📊 80% 📊 40%

🧪 测试2:金融商业深度文本 通过

输入:比亚迪2024年半年度报告摘要(711字符 / ~800 tokens)

711
输入字符
~800
估算Token
36
发现实体
22
模式匹配

📂 分类结果

金融/商业
100.0%
1块 · 0.47

🔍 提取详情

类型数量示例
💰 金额103011.27亿元, 136.31亿元, 158亿元
📊 百分比815.76%, 24.44%, 28.5%, 173.8%
📞 电话10755-89888888
📧 邮箱1ir@byd.com
🌐 URL2https://www.byd.com, www.byd.com
👤 人名14张经理 等

🧪 测试3:大规模文本性能 通过

输入:模拟66,650字符 / ~77,374 tokens的大规模文本

66,650
输入字符
~77K
估算Token
0.06s
处理耗时
3,124
字符/秒
3,000
发现实体
1,750
模式匹配
9种
实体类型

✅ 处理速度达3,124字符/秒,1M上下文(约100万token)预计处理时间 < 30秒

📖 使用指南

快速开始

场景代码示例
分析文本字符串 from semantic_engine import quick_analyze
result = quick_analyze("您的文本内容...")
分析文件 from semantic_engine import analyze_file
result = analyze_file("path/to/file.txt")
自定义类别 engine = SemanticEngine(custom_categories={"我的类别": ["关键词1", "关键词2"]})
命令行使用 python semantic_engine.py "文本内容" --output result.json