使用指南
平台完整工作流:从业务数据到生产级自动预测两条使用路径
🚀 快速路径(初次体验)
点击左侧「⚡ 自动流水线」→ 选择数据来源 → 一键执行
自动完成:清洗 → 特征 → 调优 → 回测 → 预测 → 导出
几分钟看到完整结果,适合快速了解平台能力。
自动完成:清洗 → 特征 → 调优 → 回测 → 预测 → 导出
几分钟看到完整结果,适合快速了解平台能力。
🔬 专业路径(正式建模)
按左侧 01 → 07 逐步执行,每步检查结果再进入下一步。
数据可控、参数可调、模型可比,最终交给「⟳ 预测工作流」
定时自动预测并用真实销量持续验证效果。
数据可控、参数可调、模型可比,最终交给「⟳ 预测工作流」
定时自动预测并用真实销量持续验证效果。
步骤详解
| 步骤 | 做什么 | 怎么用 / 为什么 | 产物 |
|---|---|---|---|
| 01 数据获取 | 导入历史日销量数据 | 三种方式:①生成示例数据体验;②上传 CSV/Excel(任意列名,可视化映射时间列/销量列/维度列/特征列,多文件自动合并);③数据库直连 MySQL/SQLite,支持自定义只读 SQL(JOIN/GROUP BY),连接配置自动保存,下次登录点击一键重连。建议至少 120 天历史数据。 | 原始数据表 + 数据画像 |
| 02 数据清洗 | 把脏数据变成干净的连续日序列 | 去重、修复负值、补齐缺失日期、异常值截断(IQR×k,高值原始/低值 log 双侧检测)。大促/事件日保护:38节/618/双11/双12 与自定义事件窗口内的高销量不截断——尖峰是模型要学的真实信号;骤降检测:单日骤降自动抬升修复,连续≥3天骤降判定为疑似断货/下架,保留原值并生成 is_stockout 特征(模型学会区分"没货"和"没需求");缺失填充推荐季节感知(周同期均值,保留周形态,对深度学习尤其重要)。 | 干净连续的日销量序列 + is_stockout 标记 |
| 03 维度拓展 | 特征工程:给模型提供"线索" | 勾选特征组:日历(星期/月份/年周期傅里叶1~3阶/农历春节维度)、节假日大促、自定义事件(店庆/直播等,标记后同时参与清洗保护)、滞后(lag 1/7/14/28,数据满一年自动加同比 lag364)、滑窗(均值/波动/最值 + 趋势形态 trend_7_28/dev_7/vol_ratio_7)、内部因素(价格/折扣/促销/广告)、外部因素(内置 Open-Meteo 天气 + 文件导入大盘指数等)。特征相关性排行帮助判断哪些线索有效,低相关可勾选剔除。 | 特征矩阵 + 相关性排行 |
| 04 模型调优 (可选) | 为每个模型找最佳超参数 | 网格搜索超参数,留出集 RMSE 择优。支持单模型或多模型批量对比(一次调优全部模型并排名)。回答的是"同一模型哪组配置更好"。Ridge/HW 默认参数够用,LightGBM/XGB 调优收益大。最优参数自动记入 best_params,后续勾选「使用调优参数」即生效。 | 每个模型的 best_params |
| 05 评估回测 ★ 决策步骤 | 模拟历史预测,给模型打分选模 | 多模型 4 折滚动回测:每折只用"折前"数据训练、预测"折内"数据,严格递归防止偷看未来。输出 MAPE/RMSE/R²、跨折稳定性、质量等级(A~D)、生产就绪(production_ready)。与调优分开是为了防数据泄漏——调优时参数已"见过"验证窗口,必须用独立时间段再考一次,成绩才可信。自动选模按生产门槛+稳定性综合择优,不只看 RMSE。 | 模型对比报告 + 最优模型 |
| 06 预测结果 真正的最终训练 | 全量数据训练 + 预测未来 | 用选定模型和调优参数,以全部历史数据完整训练一次(此前调优/回测训练的都是临时"陪练"模型),递归预测未来 N 天,输出 80%/95% 置信区间。支持场景假设(促销/折扣/广告投入)对比、维度批量预测(多款式/店铺)、CSV 导出与数据库回写。预测结果自动保存到你的账号。可选「LLM 修正」(见下方卡片):预测完成后由 DeepSeek 审查并按周块给修正系数,曲线/表格同时展示 ML/DL 与 LLM 修正前后对比。 | 未来 N 天预测 + 置信区间 + (可选)LLM 修正对比 |
| 07 模型仓库 | 固化模型资产 | 把训练好的模型导出为 .pkl 文件(含模型+特征清单+参数+元数据),可下载备份、加载后免训练直接预测新数据。这是交给预测工作流用的正式模型。 | .pkl 模型文件 |
| ⟳ 预测工作流 ★ 生产运行 | 定时自动预测 + 真实效果监控 | 选择已导出模型 + 业务库取数 SQL,设定调度间隔(建议 1440 分钟=每日)。到点自动:取最新数据 → 预测入库(可写回业务库)→ 把已发生日期的真实销量回填到预测明细 → 计算真实 MAPE/RMSE 累计评估历史。回测是"模拟过去",这里是"验证真实未来",是最可信的效果证明。 | 持续更新的预测表 + 真实效果曲线 |
模型怎么选(平台 20+ 个模型)
| 类别 | 模型 | 适用场景 |
|---|---|---|
| 基线 | snaive(上周同天) | 任何模型都应先跑赢它,否则不如简单规则。 |
| 梯度提升(主力) | LightGBM / XGBoost | 中小数据量最稳、训练秒级,配合调优通常最优。首选。 |
| 统计时序 | HW / SARIMA / AutoETS / AutoARIMA / AutoTheta / MSTL / AutoCES | 无需特征工程,周期规律强的数据表现好;Croston/CrostonSBA 专治间歇性稀疏销量(大量零值的长尾款)。 |
| 深度学习(单序列) | NHITS / TFT / DLinear / NLinear / PatchTST | 历史 ≥1 年、旺淡季/大促模式复杂时上限更高;NHITS/TFT 自动吃天气/价格/自定义列等未来协变量。 |
| 深度学习(全局多序列) | NHITS/TFT/DLinear/PatchTST 的「全局」变体 | 一个模型学全部款式/店铺(数据含维度列时可用);类目/平台等静态特征让新款冷启动,长尾款类目均值兜底。多款式批量预测首选。 |
🤖 ML+LLM 混合预测(预测页「LLM 修正」开关)
是什么:在 ML/DL 模型预测完成后,用 DeepSeek 审查预测合理性并按周块(7天)给出修正系数(0.70~1.30),再回放每一天,形成"ML 算数 + LLM 纠偏"的混合预测。
怎么开:预测页「预测配置」→「LLM 修正」→ 选「开(ML+LLM 混合)」→ 一键预测。默认关,只有显式开启才调用 DeepSeek(产生少量调用成本)。
结果怎么看:KPI 增加「LLM 修正后总量」卡(系数 + 差值);走势图同时画 预测值(ML/DL) 与 预测值(LLM修正) 两条曲线;明细表新增「LLM修正」列;顶部绿框展示每个周块的修正系数与 LLM 理由、置信度。
什么时候有用:ML 对趋势转折、季节错位、促销尖峰、断货误判等场景容易失真,LLM 结合历史周趋势与业务常识可以纠偏;当 ML 预测与历史趋势一致时 LLM 会保守保持原预测(系数=1.0),不会过度干预。
可靠性:LLM 调用/解析失败自动回退原预测,不影响预测流程;系数钳制 0.70~1.30,保守修正。
怎么开:预测页「预测配置」→「LLM 修正」→ 选「开(ML+LLM 混合)」→ 一键预测。默认关,只有显式开启才调用 DeepSeek(产生少量调用成本)。
结果怎么看:KPI 增加「LLM 修正后总量」卡(系数 + 差值);走势图同时画 预测值(ML/DL) 与 预测值(LLM修正) 两条曲线;明细表新增「LLM修正」列;顶部绿框展示每个周块的修正系数与 LLM 理由、置信度。
什么时候有用:ML 对趋势转折、季节错位、促销尖峰、断货误判等场景容易失真,LLM 结合历史周趋势与业务常识可以纠偏;当 ML 预测与历史趋势一致时 LLM 会保守保持原预测(系数=1.0),不会过度干预。
可靠性:LLM 调用/解析失败自动回退原预测,不影响预测流程;系数钳制 0.70~1.30,保守修正。
🧠 深度学习使用要点
什么时候用:历史 ≥1 年、有明显旺淡季/大促脉冲、或需要多款式全局建模。数据 <6 个月建议用 LGBM/统计模型。
深度面板(调优/回测/预测页选中深度模型后出现):hidden 宽度(模型容量)、层数、注意力头、训练步数(默认600)、批大小(大数据集加大提速)、置信区间(分位数网络=旺淡季自适应宽度,推荐)、早停(验证损失不降自动停,默认开)。留空即用默认/调优参数。
进度与取消:训练显示步级进度条 + 剩余时间预估(ETA)+ 折/试验进度;点「停止训练」当前训练步结束立即中止,已完成模型的结果保留。
置信区间:深度模型用 MQLoss 分位数网络直接学习 80%/95% 分位——旺季区间宽、淡季窄;预测页 KPI 卡显示「分位数网络」即生效。传统模型是固定 σ 对称区间。
深度面板(调优/回测/预测页选中深度模型后出现):hidden 宽度(模型容量)、层数、注意力头、训练步数(默认600)、批大小(大数据集加大提速)、置信区间(分位数网络=旺淡季自适应宽度,推荐)、早停(验证损失不降自动停,默认开)。留空即用默认/调优参数。
进度与取消:训练显示步级进度条 + 剩余时间预估(ETA)+ 折/试验进度;点「停止训练」当前训练步结束立即中止,已完成模型的结果保留。
置信区间:深度模型用 MQLoss 分位数网络直接学习 80%/95% 分位——旺季区间宽、淡季窄;预测页 KPI 卡显示「分位数网络」即生效。传统模型是固定 σ 对称区间。
常见问题
Q:为什么调优(04)和回测(05)要分成两步?
调优是"运动员自己练",参数在验证窗口上反复试过、成绩会虚高;回测是"独立裁判考试",用调优没见过的多个时间段再评一次。分开才能防止过拟合和数据泄漏,选出的模型上线后才不掉链子。
Q:哪一步才是真正的建模训练?
06 预测 / 07 导出时的全量训练。调优和回测阶段训练的几十个模型都是临时评估用,留下的只是参数(best_params)和评分结论。
Q:回测指标怎么判断好坏?
MAPE<10% 优秀、10~20% 良好、>30% 需改进;R²>0.8 说明模型解释了大部分波动;优先看 quality_grade(A/B 可用)和 production_ready(是否达到生产门槛),其次再比 RMSE。跨折稳定性差的模型即使平均分高也要谨慎。
Q:预测结果能再被"人"看一眼把把关吗?
可以。预测页开启「LLM 修正」后,DeepSeek 会像资深分析师一样审查 ML/DL 预测:结合最近 12 周实际销量与趋势、季节、促销等业务常识,按周块给出修正系数并附理由与置信度。页面同时展示修正前后两条曲线与明细对比,你可据此决定采用哪一版。LLM 修正失败时自动保持原预测,不会影响出数。
Q:推荐的使用节奏?
首次建模:01→02→03→04(多模型批量)→05(勾选调优参数回测选模)→06 验证→07 导出;日常:建预测工作流每日自动跑;维护:工作流真实 MAPE 持续变差时回到 04/05 重新调优选模,导出新模型替换工作流中的旧模型。
Q:大促尖峰被当异常值截掉怎么办?
清洗页默认开启「大促/事件日保护」,38节/618/双11/双12 窗口自动保护;自有活动(店庆/直播)先到 03 页标记自定义事件再清洗,对应窗口即受保护。
Q:断货期的数据要删吗?
不要删。清洗会自动识别连续≥3天骤降并标记 is_stockout(保留原值),模型能学会区分"没货"和"没需求";删掉反而丢信息。
Q:深度学习要跑多久?能中途停吗?
CPU 上单模型约 1~5 分钟(600 步);进度条有剩余时间预估;随时点「停止训练」,当前训练步结束立即中止。开启早停后收敛即自动停,不会傻跑满步数。
Q:预测区间为什么忽宽忽窄?
深度模型的分位数网络会按旺淡季自适应:波动大的时期区间自然更宽,这是特性不是 bug。备货保守按 lo80,进取按 hi80;想要固定宽度可在深度面板切「传统 σ 区间」。
Q:多款式怎么批量预测?
数据库直连页用 SQL 带出维度列(款式/店铺),底部「按维度批量预测」:普通模型逐款式独立建模(款少历史长);「全局」深度模型一个模型学全部款式(款多、含新款冷启动)。
Q:多维度(款式×平台)怎么建模?
上传页/数据库直连页选「维度列」+「组合维度2」(如 款式+平台),平台自动拼组合序列键(如 淘宝·A001),每个组合独立成一条序列。选好后点「检查维度组合」预览组合数/覆盖天数/稀疏度和建模建议再导入。原维度列自动作为全局深度模型的静态特征——模型能学到同款跨平台差异与平台内款式共性。
调优是"运动员自己练",参数在验证窗口上反复试过、成绩会虚高;回测是"独立裁判考试",用调优没见过的多个时间段再评一次。分开才能防止过拟合和数据泄漏,选出的模型上线后才不掉链子。
Q:哪一步才是真正的建模训练?
06 预测 / 07 导出时的全量训练。调优和回测阶段训练的几十个模型都是临时评估用,留下的只是参数(best_params)和评分结论。
Q:回测指标怎么判断好坏?
MAPE<10% 优秀、10~20% 良好、>30% 需改进;R²>0.8 说明模型解释了大部分波动;优先看 quality_grade(A/B 可用)和 production_ready(是否达到生产门槛),其次再比 RMSE。跨折稳定性差的模型即使平均分高也要谨慎。
Q:预测结果能再被"人"看一眼把把关吗?
可以。预测页开启「LLM 修正」后,DeepSeek 会像资深分析师一样审查 ML/DL 预测:结合最近 12 周实际销量与趋势、季节、促销等业务常识,按周块给出修正系数并附理由与置信度。页面同时展示修正前后两条曲线与明细对比,你可据此决定采用哪一版。LLM 修正失败时自动保持原预测,不会影响出数。
Q:推荐的使用节奏?
首次建模:01→02→03→04(多模型批量)→05(勾选调优参数回测选模)→06 验证→07 导出;日常:建预测工作流每日自动跑;维护:工作流真实 MAPE 持续变差时回到 04/05 重新调优选模,导出新模型替换工作流中的旧模型。
Q:大促尖峰被当异常值截掉怎么办?
清洗页默认开启「大促/事件日保护」,38节/618/双11/双12 窗口自动保护;自有活动(店庆/直播)先到 03 页标记自定义事件再清洗,对应窗口即受保护。
Q:断货期的数据要删吗?
不要删。清洗会自动识别连续≥3天骤降并标记 is_stockout(保留原值),模型能学会区分"没货"和"没需求";删掉反而丢信息。
Q:深度学习要跑多久?能中途停吗?
CPU 上单模型约 1~5 分钟(600 步);进度条有剩余时间预估;随时点「停止训练」,当前训练步结束立即中止。开启早停后收敛即自动停,不会傻跑满步数。
Q:预测区间为什么忽宽忽窄?
深度模型的分位数网络会按旺淡季自适应:波动大的时期区间自然更宽,这是特性不是 bug。备货保守按 lo80,进取按 hi80;想要固定宽度可在深度面板切「传统 σ 区间」。
Q:多款式怎么批量预测?
数据库直连页用 SQL 带出维度列(款式/店铺),底部「按维度批量预测」:普通模型逐款式独立建模(款少历史长);「全局」深度模型一个模型学全部款式(款多、含新款冷启动)。
Q:多维度(款式×平台)怎么建模?
上传页/数据库直连页选「维度列」+「组合维度2」(如 款式+平台),平台自动拼组合序列键(如 淘宝·A001),每个组合独立成一条序列。选好后点「检查维度组合」预览组合数/覆盖天数/稀疏度和建模建议再导入。原维度列自动作为全局深度模型的静态特征——模型能学到同款跨平台差异与平台内款式共性。
预测工作流
定时加载已训练模型 → 业务库取数 → 预测入库 → 回填真实销量 → 评估真实效果新建工作流
高级设置(验证 / 精度提醒 / 写回业务库,可留空)
数据来源
当前取数已就绪:加载中…
将复用「数据获取」页已加载的数据源连接、SQL、列名与维度配置,无需重复填写;若未加载数据请切到「手动配置」。
将复用「数据获取」页已加载的数据源连接、SQL、列名与维度配置,无需重复填写;若未加载数据请切到「手动配置」。
我的工作流
加载中
预测查询
按工作流/日期/款式筛选预测明细,可导出 CSV 或生成 SQL筛选条件
请选择工作流后查询
我的记录
当前账号保存的数据源、训练任务和模型记录业务数据源
加载中
训练与预测任务
加载中
我的模型
加载中
用户管理
管理平台账号、角色和启停状态创建用户
账号列表
加载中
自动流水线
一键执行:数据 → 清洗 → 维度拓展 → 调优 → 多模型回测 → 预测 → 导出最优模型 → AI 解读流水线配置
参与回测对比的模型
流水线执行中,视配置需 1~5 分钟
数据获取
导入历史销量数据,或使用内置示例数据集(含内部/外部因素与脏数据)示例数据集
生成两年模拟电商日销量:趋势 + 年/周季节性 + 大促脉冲(618/双11/双12), 内部因素(价格·折扣·促销·广告),外部因素(气温·行业指数·竞品促销), 并注入缺失值 / 异常尖峰 / 负值 / 重复行用于演示清洗。
上传业务数据
拖拽 CSV / Excel 文件至此(支持多选),或点击选择
不限列名格式——上传后可视化选择时间列 / 销量列 / 维度列 / 特征列;多个文件(如按月导出)自动按列合并、按行去重
不限列名格式——上传后可视化选择时间列 / 销量列 / 维度列 / 特征列;多个文件(如按月导出)自动按列合并、按行去重
数据库直连(MySQL)
数据清洗
去重 · 非法值修复 · 缺口补全 · 异常值处理 · 缺失填充清洗策略配置
清洗中
维度拓展
特征工程:从时间结构、业务因素中构造预测维度特征组选择
构建中
时序事件标记
手动标记历史或未来的业务事件(自有大促、断货、店庆、直播等),生成事件及前后窗口特征;未来日期的事件在预测时同样生效。标记后勾选上方「自定义事件标记」特征组。
外部因素导入(大盘指数 / 天气等)
上传 CSV/Excel:需包含日期列 + 数值列(如大盘成交指数、行业指数、气温、降雨量)。按日期自动对齐合并到当前数据;若文件覆盖未来日期,预测时将使用真实未来外部值(如天气预报、行业预估)。可多次导入不同来源。导入后勾选「外部因素」特征组。
内置来源:Open-Meteo 全国 14 城(北京/上海/广州/成都/武汉/哈尔滨/乌鲁木齐/昆明等)日均气温取平均(含降水),免费无需 key;历史覆盖训练期、未来 16 天为真实预报,预报期之后自动延伸「历史同期气候均值」(±5 天窗口多年平均)至今天+45 天——30/45 天预测的天气特征全程可用。「全国平均」合并为一个主维度,「分城市」各城温度单独成维。导入后每日 06:30 自动重拉保鲜,预报不过期。
模型调优
网格搜索超参数,留出集 RMSE 择优,最优参数自动记录调优配置
勾选 1 个模型 = 单模型调优;勾选多个 = 批量调优横向对比
评估回测
滚动起点回测(Rolling-Origin Backtest),多模型多指标横向对比回测配置
预测结果
未来销量预测 · 80%/95% 置信区间 · 业务场景假设模拟预测配置
场景假设(可选 · 覆盖未来内部因素)
模型仓库
训练好的模型导出为 .pkl 文件,可下载部署,或直接加载预测(免重新训练)导出当前模型
导出的 .pkl 包含:训练好的模型 + 标准化器 + 特征清单 + 特征组配置 + 回测指标 + 残差σ,可独立用于预测。
已导出模型
暂无导出模型
用模型文件直接预测
全局模型(*_global)完全离线预测:模型文件自带训练数据/权重/预测起点/天气,无需加载数据或清洗。结果直接显示在「06 预测结果」页。