| 123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277 |
- # -*- coding: utf-8 -*-
- """windscada 场配置 (契约化可迁场 + 场站目录扫描辨识).
- ## 一、离线数据怎么放 (2026-09-11 用户令)
- 所有离线数据统一放 **`data/raw/`**, 其**下一级目录即「场站名称」**; 系统**扫描辨识**, 不写死目录名:
- data/raw/
- <场站名称>/ ← 扫描辨识的抓手: 下一级目录就是场站
- scada_10min/ SCADA 10min 导出, 逐台平铺 WTG01.csv…WTG38.csv
- scada_1min/ (可选) 1min 导出
- 故障报警/ 报警事件导出 (SpreadsheetML *.xls)
- 风机故障记录/ 检修工单台账 (*.xls/xlsx, 内按 {年}年故障记录/ 分年)
- 油样报告/ 油液化验报告 (*.pdf)
- 西门子4.0技术资料/ 机理层 (厂商资料), 仍在 raw 根下, 按 A2 未入场站目录
- 辨识规则 (逐条, 命中即止, 依据可打印):
- ① 场配置的 `raw_station` 与目录名**完全相同**;
- ② 目录名与场配置 `src_farm_names` (原始件里的场站名写法) 互为子串 —— 如配置「如东」对上目录「如东海上风电场」;
- ③ `data/raw` 下**只有一个**场站目录 (单站部署) → 用它, 但报告里标出"凭单站唯一性", 不假装是精确匹配;
- ④ 其余情形 (多个目录且都不匹配) → **不猜**, 返回"未识别", 页面显示无数据并列出扫到的目录。
- 命中/未命中的依据由 station_report() 给出, 供 CLI 与维护页显示。
- ## 二、场配置怎么来
- 2026-08-28 多场化改造: 场定义 = 外部配置 (`app_ETL/configs/farms/<场名>.yaml`, 历史 `.json` 兼容) + 内置默认
- (rudong 是已跑通的正本, 保证零配置也能起)。当前场由 `WINDSCADA_FARM` 或 set_current() 指定。
- **外场配置若显式给了 src_*, 以它为准**; 没给就按上面的扫描结果派生 (外场不必再抄一遍路径)。
- ★ 2026-09-17 (用户令 2 统一配置): 路径一律走 `src/paths.py` 的 `P.farm_config()` / `P.config_dir('farms')`,
- 不再在本文件里手拼 `app_ETL/configs/farms/...`; 格式约定 = **YAML**(新场写 yaml), 且 yaml 与 json 都能被
- `available()` 列出 —— 此前只认 json, 目录里 8 个 yaml 场定义等于"配了看不见"。
- """
- try:
- from app_common.app_common_guanlan.api import install_root as _install_root
- except ImportError: # 极端兜底(包结构异常时按位置上跳)
- from pathlib import Path as _P
- def _install_root(_f): return _P(_f).resolve().parents[3]
- from pathlib import Path
- import json
- import os
- import sys as _sys
- _sys.path.insert(0, str(_install_root(__file__))) # 便于 `python src/windscada/config.py`
- from src import paths as P # 路径唯一真源 (ROOT/相对解析都在它那)
- ROOT = P.ROOT
- FARM_DIR = P.FARMS
- # 一个场必须给齐的键 — 缺任何一个都会在加载时响亮报错, 而不是等到分析中途才崩
- REQUIRED = ('name', 'n_turbines', 'turbines', 'src_10min', 'src_alarm', 'store', 'rated_kw')
- # 原始件根: data/raw (env WINDSCADA_RUDONG_SRC 或 configs/serve.json 的 raw_dir 可覆盖, 启动器会导出)。
- # 注意这里给的是**绝对路径对象**, 但它是由 ROOT 派生的 —— 安装目录整个拷走也不会失配。
- RUDONG_SRC = str(P.RAW_ROOT)
- RAW_ROOT = P.RAW_ROOT
- # 场站目录下的**约定子目录名** — 这些名字是摄入侧的接口, 改名等于换接口, 要同步 README 与维护页
- # 振动侧两目录 (2026-09-12 用户令: 「CMS 振动评估报告」遵循 data/raw/如东/windcms、
- # 「振动线 handoff」遵循 data/raw/如东/m5_cms_tcm) —— 它们此前只在 outputs/ 下以**产物**形式存在,
- # 源件不在 data/raw, 于是"从零重算"时振动侧无源可算。加进来后扫描/落位/数据层页都能认它们。
- STATION_SUBDIRS = ('scada_10min', 'scada_1min', '故障报警', '风机故障记录', '油样报告',
- 'windcms', 'm5_cms_tcm',
- # 2026-09-17 用户令: 现场交来的**年度 MDB 归档**(25年.zip / 26年.zip, 内层是
- # `<年>/<月>/<年-月-类>.zip → .mdb`)就地放在场站目录下, 取代此前的"已导出 CSV"
- # 那两个 zip(10分钟数据.zip / 1分钟数据.zip)。原始收资是 Access 库, 故单独一层。
- 'scada_mdb')
- _SRC_KEYS = (('src_10min', 'scada_10min'), ('src_1min', 'scada_1min'), ('src_alarm', '故障报警'),
- ('src_workorder', '风机故障记录'), ('src_oil', '油样报告'),
- ('src_windcms', 'windcms'), ('src_m5', 'm5_cms_tcm'), ('src_mdb', 'scada_mdb'))
- _BUILTIN = {
- 'rudong': {
- 'name': '如东海上风电场', 'n_turbines': 38,
- 'turbines': [f'WTG{i:02d}' for i in range(1, 39)],
- 'raw_station': '如东', # data/raw/<场站名称> 的**首选**目录名
- # 原始件里的**场站名写法**: 集团口径导出件 (月度/年度台账) 用「如海风电场」,
- # 而本场配置名是「如东海上风电场」。台账/报警摄入按这些别名把本场行筛出来 ——
- # 实测 2021年3月那张汇总表里混着民勤/来福/宝力格/大岗子/宏基… 十来个场站的行。
- 'src_farm_names': ['如海', '如东'],
- 'store': P.store('rudong'), # L0 标准仓 (outputs/rudong/windscada)
- 'contract': P.contract('rudong'), # M1 产出 (reference/rudong/windscada_contract.yaml)
- 'rated_kw': 4000,
- }
- }
- _CACHE = {}
- _CURRENT = [os.environ.get('WINDSCADA_FARM') or 'rudong']
- def scan_stations(root=None):
- """扫 data/raw 的**下一级目录** = 场站目录。→ {场站名: dict(dir, subdirs, n_files)}
- 只列目录, 不读内容 —— 现场目录里可能是十几 GB 的 CSV。
- """
- root = Path(root or RAW_ROOT)
- out = {}
- if not root.is_dir():
- return out
- for d in sorted(p for p in root.iterdir() if p.is_dir()):
- subdirs = {n: d / n for n in STATION_SUBDIRS if (d / n).is_dir()}
- n_files = sum(1 for p in d.rglob('*') if p.is_file())
- out[d.name] = dict(dir=d, subdirs=subdirs, n_files=n_files)
- return out
- def station_scan(cfg=None, root=None):
- """扫 + 辨 → dict(stations={...}, matched=Path|None, name=str|None, how=str, note=str)。
- how: 'raw_station' | 'alias' | 'single' | 'none' —— 页面/CLI 显示"凭什么认出这个场站目录"。
- """
- stations = scan_stations(root)
- cfg = cfg or {}
- want = str(cfg.get('raw_station') or '')
- aliases = [str(a) for a in (cfg.get('src_farm_names') or []) if a]
- if not stations:
- return dict(stations=stations, matched=None, name=None, how='none',
- note=f'{Path(root or RAW_ROOT)} 下没有任何场站目录 → 系统无数据可呈现')
- if want and want in stations:
- return dict(stations=stations, matched=stations[want]['dir'], name=want, how='raw_station',
- note=f'目录名与场配置 raw_station 完全相同: {want}')
- for nm, info in stations.items():
- if any(a in nm or nm in a for a in aliases):
- return dict(stations=stations, matched=info['dir'], name=nm, how='alias',
- note=f'目录名 {nm} 与场名写法 {aliases} 匹配')
- if len(stations) == 1:
- nm = next(iter(stations))
- return dict(stations=stations, matched=stations[nm]['dir'], name=nm, how='single',
- note=f'data/raw 下只有这一个场站目录 {nm} (单站部署) → 采用它; '
- f'若这不是本场, 请把目录名改成 {want or "场配置里的场站名"}')
- return dict(stations=stations, matched=None, name=None, how='none',
- note=f'data/raw 下有 {len(stations)} 个场站目录 {sorted(stations)}, 但没有一个能对上'
- f'本场 (raw_station={want!r} / 场名写法={aliases}) → 不猜, 页面显示无数据')
- def station_report(cfg=None, root=None):
- """给 CLI 与维护页用的报告: 辨识结论 + 各约定子目录的件数。"""
- r = station_scan(cfg or farm(), root)
- counts = {}
- if r['matched']:
- for n in STATION_SUBDIRS:
- d = Path(r['matched']) / n
- counts[n] = sum(1 for p in d.rglob('*') if p.is_file()) if d.is_dir() else 0
- r['counts'] = counts
- return r
- def _expand(cfg, name):
- """展开: turbines 简写 / 相对路径 / **按扫描结果派生 src_***。
- 显式给了 src_* 的 (外场配置常见) 一律不动 —— 扫描只填空白, 不覆盖声明。
- """
- c = dict(cfg)
- t = c.get('turbines')
- if isinstance(t, str) and ':' in t:
- pat, rng = t.rsplit(':', 1)
- a, b = (int(x) for x in rng.split('-'))
- c['turbines'] = [pat.format(i) for i in range(a, b + 1)]
- c.setdefault('n_turbines', len(c.get('turbines') or []))
- for k in ('store', 'contract'):
- if c.get(k) and not str(c[k]).startswith('/'):
- c[k] = ROOT / str(c[k])
- c.setdefault('store', P.store(name))
- # ★场站目录: 扫描辨识 (见模块头)。扫不到就指向"约定位置", 让页面能告诉人该往哪放。
- scan = station_scan(c)
- expected = RAW_ROOT / str(c.get('raw_station') or name)
- station = Path(scan['matched']) if scan['matched'] else expected
- c['raw_station_dir'] = str(station)
- c['station_how'] = scan['how']
- c['station_note'] = scan['note']
- c['n_stations'] = len(scan['stations'])
- for key, sub in _SRC_KEYS:
- c.setdefault(key, str(station / sub))
- miss = [k for k in REQUIRED if not c.get(k)]
- if miss:
- raise SystemExit(f'场配置 {name} 缺必需键: {miss} (见 config.REQUIRED)')
- return c
- def farm_files():
- """`app_ETL/configs/farms/` 下的候选场定义文件 (yaml/json), 不含模板/CSV。"""
- if not FARM_DIR.is_dir():
- return []
- pats = ('*.yaml', '*.yml', '*.json')
- out = []
- for p in pats:
- out += [f for f in FARM_DIR.glob(p) if not f.name.startswith('_')]
- return sorted(out)
- def is_farm_def(f) -> bool:
- """这个文件是不是一份**能加载的场定义**(必需键齐)。"""
- try:
- c = _load_farm_file(Path(f))
- except Exception:
- return False
- return isinstance(c, dict) and all(c.get(k) for k in REQUIRED)
- def available():
- """列出可用场: 内置 + 能加载的 `app_ETL/configs/farms/<场名>.{yaml,json}`。
- ★ 2026-09-17 修两件事 (用户令 2 "统一配置"):
- ① 原来只认 `*.json` ⇒ 目录里的 `.yaml` **配了看不见**; 现在 yaml/json 都认 (新场写 yaml);
- ② 但这个目录里混着**另一种 schema** 的文件 (机型/场站物理约束 profile: `meta` + `physical_constraints`),
- 它们**不是**场定义, 列进"可用场"会在加载时炸。所以只列真能加载的, 其余的由
- `foreign_farm_files()` 报出来, 由 `scripts/config_audit.py` 记账 (见 docs §11)。
- """
- out = dict.fromkeys(_BUILTIN, '内置')
- for f in farm_files():
- if is_farm_def(f):
- out[f.stem] = str(f.relative_to(ROOT))
- return out
- def foreign_farm_files():
- """`app_ETL/configs/farms/` 下"不是场定义"的文件 → [(文件, 依据)] (登记在册, 不参与场加载)。"""
- bad = []
- for f in farm_files():
- if is_farm_def(f):
- continue
- try:
- c = _load_farm_file(f)
- keys = ','.join(sorted(c)[:4]) if isinstance(c, dict) else type(c).__name__
- except Exception as e:
- keys = f'解析失败: {type(e).__name__}'
- bad.append((f, keys))
- return bad
- def _load_farm_file(f: Path):
- """读场定义 —— 按后缀选解析器 (yaml 优先/约定; json 兼容历史)。"""
- text = f.read_text(encoding='utf-8-sig')
- if f.suffix.lower() in ('.yaml', '.yml'):
- import yaml
- return yaml.safe_load(text) or {}
- return json.loads(text)
- def set_current(name):
- farm(name) # 先验证能加载
- _CURRENT[0] = name
- return name
- def current():
- return _CURRENT[0]
- def farm(name=None, refresh=False):
- """取场配置; refresh=True 重扫场站目录 (放了新数据、又不想重启服务时用)。"""
- name = name or _CURRENT[0]
- if name in _CACHE and not refresh:
- return _CACHE[name]
- if name in _BUILTIN:
- _CACHE[name] = _expand(_BUILTIN[name], name)
- return _CACHE[name]
- f = P.farm_config(name) # yaml 优先, json 兼容 (路径真源在 src/paths.py)
- if f is None or not is_farm_def(f):
- extra = ''
- if f is not None:
- extra = (f' —— 该文件存在但**不是场定义**(缺必需键 {list(REQUIRED)}); '
- f'如果是机型/物理约束 profile, 它属于另一种 schema, 见 docs §11')
- raise SystemExit(f'未知场 {name}; 可用: {list(available())}{extra} '
- f'(新场请在 {FARM_DIR.relative_to(ROOT)}/ 放 <场名>.yaml, 必需键见 config.REQUIRED)')
- _CACHE[name] = _expand(_load_farm_file(f), name)
- return _CACHE[name]
- def raw_station_dir(name=None):
- """本场原始件根目录 = data/raw/<场站名称>。
- 扫描辨识到就用它; 没辨识到则返回**约定位置** <raw_root>/<raw_station>, 这样维护页仍能
- 指着正确的地方让人补数据 (而不是给一个空路径)。辨识依据见 farm()['station_note']。
- """
- return Path(str(farm(name)['raw_station_dir']))
|