新功能 - 列头筛选:Excel风格筛选功能(Community版本,中文本地化,显示唯一值及计数) - 行号列:添加固定行号列(#列头,灰色背景,左侧固定) - 全量数据加载:不再限制50行预览,Session加载全量数据 - 全量数据返回:所有快速操作(筛选/映射/分箱/条件/删NA/计算/Pivot)全量返回结果 Bug修复 - 滚动条终极修复:修改MainLayout为固定高度(h-screen + overflow-hidden),整个浏览器窗口无滚动条,只有AG Grid内部滚动 - 计算列全角字符修复:自动转换中文括号等全角字符为半角 - 计算列特殊字符列名修复:完善列别名机制,支持任意特殊字符列名 UI优化 - 删除'表格仅展示前50行'提示条,减少干扰 - 筛选对话框美化:白色背景,圆角,阴影 - 列头筛选图标优化:清晰可见,易于点击 文档更新 - 工具C_功能按钮开发计划_V1.0.md:添加V1.5版本记录 - 工具C_MVP开发_TODO清单.md:添加Day 8 UX优化内容 - 00-工具C当前状态与开发指南.md:更新进度为98% - 00-模块当前状态与开发指南.md:更新DC模块状态 - 00-系统当前状态与开发指南.md:更新系统整体状态 影响范围 - Python微服务:无修改 - Node.js后端:5处代码修改(SessionService + QuickActionController + AICodeService) - 前端:MainLayout + DataGrid + ag-grid-custom.css + index.tsx - 完成度:Tool C整体完成度提升至98% 代码统计 - 修改文件:~15个文件 - 新增行数:~200行 - 修改行数:~150行 Co-authored-by: AI Assistant <assistant@example.com>
DC - 数据清洗整理
模块代号: DC (Data Cleaning)
开发状态: ⏳ 规划中
商业价值: ⭐⭐⭐⭐⭐ 可独立售卖
独立性: ⭐⭐⭐⭐⭐
优先级: P1
📋 模块概述
数据清洗整理模块提供专业工具,处理医院导出的海量(百万行级)、多表格的Excel数据。
核心价值: 核心差异化功能,解决医学科研痛点
🎯 核心功能
1. 表格ETL(重点)
- 多张Excel表格导入
- 按"患者ID"和"时间"自动JOIN
- 重组为干净的分析宽表
2. 文本提取(NER)(重点)
- 从病理报告提取结构化字段
- 从住院小结提取关键信息
- TNM分期自动识别
3. 数据质量报告
- 缺失值统计
- 异常值检测
- 数据质量评分
4. 导出标准化数据
- Excel导出
- SPSS格式
- R语言格式
📂 文档结构
DC-数据清洗整理/
├── [AI对接] DC快速上下文.md # ⏳ 待创建
├── 00-项目概述/
│ └── 01-产品需求文档(PRD).md # ⏳ 待创建
├── 01-设计文档/
│ ├── 01-ETL引擎设计.md # ⏳ 待创建
│ └── 02-医学NLP设计.md # ⏳ 待创建
└── README.md # ✅ 当前文档
🔗 依赖的通用能力
- LLM网关 - 医学NER提取(云端版)
- 文档处理引擎 - Excel/Docx读取
- ETL引擎 - 数据清洗和转换
- 医学NLP引擎 - 实体识别(单机版)
🎯 商业模式
目标客户: 临床科室、数据管理员
售卖方式: 独立产品
定价策略: 按项目数或一次性License
⚠️ 技术难点
- 大数据处理 - 百万行数据的内存管理
- 隐私保护 - 单机版必须100%本地化
- NER准确率 - 医学术语复杂
最后更新: 2025-11-06
维护人: 技术架构师