# 数学建模基本规范知识库

本文件只提供长期稳定的数学建模规范和防错知识。不要把它当作固定产出模板，也不要因为这里列了某类检查就强行增加不必要的文件或流程。具体产物仍以当前 skill 和用户要求为准。

## 目录

| 小节 | 主要使用方 |
| --- | --- |
| [赛题理解与子问题识别](#赛题理解与子问题识别) | `2analysis-modeling` |
| [假设与模型建立](#假设与模型建立) | `2analysis-modeling` |
| [题型防错速查](#题型防错速查) | `2analysis-modeling` `3coding-visual` |
| [代码实现与结果](#代码实现与结果) | `3coding-visual` |
| [编码阶段常见错误](#编码阶段常见错误) | `3coding-visual` |
| [图表与可视化](#图表与可视化) | `3coding-visual` `4drawio` `5writing` |
| [非数据图工具选择](#非数据图工具选择) | `4drawio` `5writing` |
| [论文写作](#论文写作) | `5writing` |
| [论文验收与一致性](#论文验收与一致性) | `6verity` |
| [模型大分类与选型速查](#模型大分类与选型速查) | `2analysis-modeling` |
| [评价类模型详细指南](#评价类模型详细指南) | `2analysis-modeling` `3coding-visual` |
| [预测类模型详细指南](#预测类模型详细指南) | `2analysis-modeling` `3coding-visual` |
| [优化类模型详细指南](#优化类模型详细指南) | `2analysis-modeling` `3coding-visual` |
| [机理/动力学类模型详细指南](#机理动力学类模型详细指南) | `2analysis-modeling` `3coding-visual` |
| [图论与网络类模型](#图论与网络类模型) | `2analysis-modeling` `3coding-visual` |
| [统计分析与机器学习](#统计分析与机器学习) | `2analysis-modeling` `3coding-visual` |
| [论文写作规范补充](#论文写作规范补充) | `5writing` |
| [美赛（MCM/ICM）专项规范](#美赛mcmicm专项规范) | `5writing` |

---

## 赛题理解与子问题识别

- 先确认赛题原文来源是否可靠。PDF、扫描件、公式、上标下标、单位和表格字段要二次核对；公式被错误抽取会直接导致模型方向错误。
- 子问题只认题面明确编号的顶层问题，例如“问题一/问题二”“Problem 1/2”。不要把背景描述、数据说明、提交要求、小问编号或附件说明误当成独立子问题。
- 每个子问题都要说清输入、输出、决策变量或预测对象、评价指标、约束条件，以及与其他子问题的递进或依赖关系。
- 对题面中的模糊表述先列出两种以上解释，再用逻辑、简单验算或问题递进性判断采用哪一种。不要拿到题就直接定模型。
- 如果后续问题增加资源、约束、场景或信息，但在当前解释下结果几乎不变，要回头审查基础假设。

## 假设与模型建立

- 假设必须必要、可解释、可参数化。每个关键假设应说明理由、影响范围和替代解释。
- 物理约束和业务约束优先级高于拟合好看；计算方便不能成为删除关键机制的理由。
- 优化类问题要明确 min/max、决策变量类型、上下界、全部约束、可行解构造方法和求解算法适用规模。
- 多目标模型必须先处理量纲和归一化，再说明权重来源。不能直接把成本、时间、风险等不同量纲指标相加。
- 预测类问题要防止数据泄露。时间序列不能用未来信息训练当前预测；分类/回归要有训练验证划分或其他合理误差评估。
- 评价类问题要说明指标正负向、标准化方式、权重来源和敏感性检验；综合得分排序不能只给结果不解释机制。
- 动力学、微分方程和仿真类问题要说明状态变量单位、初始条件、边界条件、求解器选择和步长/网格收敛性。
- 图论、路径、调度类问题要检查连通性、容量、时间窗、前驱关系、子回路、整数可行性和对称资源。
- 启发式算法不能直接宣称全局最优，除非有证明、精确求解对照或足够可信的稳定性验证。

## 题型防错速查

- 优化、调度、选址、路径、装箱：不要漏非负约束、整数约束、容量约束、预算约束、时间窗和前驱约束；连续松弛后必须说明取整和修复策略；非凸或启发式求解要做多起点或多随机种子稳定性检查。
- 多资源或多阶段优化：后续问题如果有更多资源或更大可行域，目标值通常应按预期方向改善；若没有改善，优先检查新增资源是否被目标函数利用、约束是否写反、搜索是否陷入局部最优。
- 多目标优化：先对各目标独立无量纲化，再加权或做 Pareto 分析；报告各目标分量贡献，防止某个大数值目标淹没其他目标。
- 维度较高的黑箱优化：决策维度较高时先做变量分组、几何降维、物理降维或分层优化；不要把十几个以上变量直接丢给 GA/PSO/DE 后接受结果。
- 微分方程、动力学、物理仿真：写清状态变量单位、初始条件、边界条件、接触/饱和/反弹等物理约束；刚性系统用合适求解器；检查守恒量、漂移和步长收敛性。
- 统计、回归、预测：时序数据按时间划分；标准化只能在训练集 fit 后用于测试集 transform；检查残差、多重共线性、异常值、外推范围和预测值物理边界。
- 评价、排名、决策：正向/负向指标先统一方向，权重和为 1；AHP 要检查一致性；TOPSIS/熵权/DEA 等要说明无量纲化方法和排名敏感性。
- 图论、网络流、路径规划：明确有向/无向、权重、容量和连通性；负权边不能用 Dijkstra；最大流要满足流量守恒；TSP/VRP 要防止子回路和不可行路径。
- 几何、空间优化、布局：有尺寸的实体不能降维成中心点；碰撞、遮蔽、覆盖、可见性应作用于完整边界或给出等价性证明；旋转矩形不要用 AABB，优先 OBB/SAT；坐标系和角度单位要统一。
- 动态规划、博弈、排队：状态空间、转移方程、边界条件要完整；排队论先验证稳态条件；博弈问题要区分纳什均衡、帕累托最优和最优响应。
- 机器学习、数据挖掘：不要在测试集调参；类别不平衡要处理；特征工程要有业务含义；超参数搜索范围、评估指标和交叉验证方案要与任务匹配。

## 代码实现与结果

- 代码应兑现建模报告中的算法、约束和参数。若必须替代，要在结果记录里明确说明原因、替代方案和影响。
- 先保证可行解，再追求优化目标。任何输出方案都要逐条回代检查约束。
- 随机算法要固定随机种子，并用多次运行或稳定性指标说明结果可信度。
- 结果文件应记录关键参数、核心数值、约束检查、灵敏度或鲁棒性结果，以及可复现运行方式。
- 所有论文会引用的数值必须能追溯到结果记录、结果 JSON、表格或代码输出；不要在论文阶段重新估算或换一套四舍五入口径。
- 数据型图表应由真实结果数据生成，并保存图表对应的数据来源；概念流程图和路线图不应冒充数据图。

## 编码阶段常见错误

- `scipy.optimize.minimize` 只做最小化；最大化利润、覆盖率或得分时要对目标函数取负，并在结果记录中还原真实目标值。
- `scipy` 不等式约束方向是 `fun(x) >= 0`；容量约束、下界约束、预算约束最容易写反，写完要代入几个边界点检查符号。
- 不要只相信求解器的 `success`。最优解必须重新代入所有约束函数，输出每条约束的值、边界、松弛量和是否活跃。
- 整数变量、0-1 变量、人数、车辆数、批次数等不能停留在连续解。取整后必须重新验证可行性；不可行时用明确的修复启发式，而不是直接四舍五入。
- 物理参数、单位和符号必须与建模报告一致。代码里不要出现与报告不一致的长度、质量、速度、半径、时间步长或坐标原点。
- 数据读取后先检查编码、列名、形状、单位、缺失值和异常值。不要在数据错位或列名乱码时继续建模。
- 预测代码要防数据泄露：划分数据后再 fit scaler/encoder；时序问题不能随机打乱；测试集不能参与调参。
- 图论代码要检查节点数、边数、有向性、负权边、连通性和容量；最大流实现要有残量网络或等价机制。
- 几何代码要避免中心距替代实体碰撞；遮蔽/覆盖类函数的参数应包含完整几何尺寸，离散采样近似要做采样数收敛检查。
- 数值代码要检查矩阵条件数、收敛状态、迭代次数、步长减半结果、随机种子复现性和边界输入。
- JSON 或结果表必须保存每个子问题的关键数值、约束检查、图表数据来源和可复现参数；不要只把最终一句结论写进 Markdown。

## 图表与可视化

- 图表要服务论证，不为凑数量而画。每张图应能回答一个明确问题：趋势、分布、对比、关系、结构或流程。
- 数据图常见选择：趋势用折线图，排名用条形/棒棒糖图，分布用箱线/小提琴/直方图，关系用散点/热力图，模型对比用分组柱状图或指标矩阵。
- 非数据图常见选择：技术路线图、数据处理流程图、子问题求解流程图、变量关系图、模型结构图、指标体系图。
- 图中文字、坐标轴、图例和 caption 应与论文语言一致。图内不要写长标题，标题交给论文 caption。
- 同类图表风格要统一，颜色要能灰度区分，避免过度装饰、阴影和无意义渐变。

## 非数据图工具选择

- DrawIO 适合技术路线图、子问题求解流程图、数据处理 Pipeline、指标体系层次图、模型选择决策树、甘特图、小规模网络拓扑和简单概念框架。
- TikZ 适合需要精确数学标注、公式节点、复杂连线、2D 几何、变量关系、因果路径、模型架构或自定义算法流程的图。
- Matplotlib/networkx 适合节点较多、需要由数据驱动布局或需要标注最优路径/权重的网络图。
- 生成式图片只适合物理或工程场景示意图，例如 3D 空间几何、圆柱/球体/曲面、无人机/传感器/交通等场景；不要用它替代需要精确公式和可编辑结构的图。
- 速查：需要公式或精确连线时优先 TikZ；需要可编辑流程结构时优先 DrawIO；需要真实场景或复杂 3D 视觉时才考虑生成式图片。
- 不管使用哪种工具，图中文字都要与论文语言一致，图形要有明确论文用途，并在正文中配套解释。

## 论文写作

- 论文不是工作日志。正文中不要出现内部文件名、脚本名、临时目录、工作流说明或“由 AI 生成”等过程痕迹。
- 摘要或 Summary Sheet 要覆盖每个子问题的方法和关键结果，数值必须与结果记录一致。
- 公式出现后要解释符号含义；图表出现前后要有引导和解释，不能连续堆图。
- 章节结构跟随赛题类型和论文模板。三问建模题通常按问题展开；统计建模可按研究逻辑链组织，不必硬凑“问题一二三”。
- 参考文献必须真实存在。没有把握的文献不要写入，不要为显得学术而编造引用。

## 论文验收与一致性

- 验收应先识别项目实际布局：论文入口、章节文件、参考文献、图表目录、结果记录、代码入口。不要把目录名或文件名写死。
- 硬错误包括：核心正文缺失、入口 include 文件不存在、占位符残留、图片路径不存在、关键数值与结果记录冲突、模板结构被破坏、可用编译器下编译失败。
- 警告包括：未引用备用图、章节过短、图表后缺少解释、caption 过长、参考文献偏少、代码完整复现耗时过长。
- 如果验收发现模型假设或结果本身错误，应标记为需要返回前序阶段；验收阶段只做小范围修复，不重新设计模型。

---

## 模型大分类与选型速查

### 五大题型识别

| 题型 | 核心问法 | 典型场景 |
| --- | --- | --- |
| 优化类 | 求最大/最小，资源怎么分配 | 路径规划、调度、选址、装箱、投资组合 |
| 预测类 | 预测未来数值或趋势 | 销量/人口/价格预测、时序分析 |
| 评价类 | 对多方案综合排序或打分 | 城市评级、供应商选择、方案比选 |
| 分类/聚类类 | 判断对象属于哪类，或自动分群 | 风险识别、客户分群、图像识别 |
| 机理/动力学类 | 描述系统随时间的演化规律 | 传染病传播、生态系统、物理仿真 |

拿到题后先问：输出是一个数（优化）、一条序列（预测）、一个排名（评价）、一个类别标签（分类）还是一组微分方程（机理）？混合题型按主问题定主模型，子问题按实际需求叠加。

### 选型决策树（快速版）

```
要预测未来数值？
  数据量 < 15 → GM(1,1) 灰色预测
  纯时序、无外部变量 → ARIMA / 指数平滑 / Prophet
  有多个影响因素 → 线性回归 / 岭回归 / 随机森林 / XGBoost
  非线性很强 → LSTM / GRU / XGBoost
  需要不确定性区间 → Bootstrap / MCMC

要评价/排序/选方案？
  需要体现专家经验 → AHP（主观赋权）
  完全客观数据驱动 → 熵权法（客观赋权）
  方案间距离排序 → TOPSIS / AHP+TOPSIS
  指标有模糊语言（好/中/差）→ 模糊综合评价
  评价效率（投入产出比）→ DEA
  数据少、信息不全 → 灰色关联分析
  指标多高度相关 → PCA + TOPSIS

要优化（求最大/最小）？
  目标和约束都是线性 → 线性规划 (LP)
  含整数/0-1 变量 → 整数规划 (IP/MIP)
  非线性目标或约束 → 非线性规划 / 遗传算法 / 模拟退火
  多目标冲突 → NSGA-II / 加权和法 / ε-约束法
  序贯决策 → 动态规划

要分类/分群？
  有标签（监督）→ 随机森林 / SVM / Logistic 回归 / 决策树
  无标签（无监督）→ K-means / 层次聚类 / DBSCAN
  文本/情感分析 → TF-IDF + LDA / BERT

要建机理模型？
  连续时间系统 → 常微分方程 ODE（SIR、Lotka-Volterra、Logistic 增长）
  偏微分/空间扩散 → PDE / 有限差分
  离散时间系统 → 差分方程 / 马尔可夫链
  不确定性/风险 → 蒙特卡洛模拟
  空间离散演化 → 元胞自动机
```

---

## 评价类模型详细指南

### 选型原则

| 场景 | 推荐方法 |
| --- | --- |
| 有专家经验、需要层次结构 | AHP |
| 纯数据驱动、需要客观权重 | 熵权法 |
| 多方案综合排序 | TOPSIS（配合 AHP 或熵权） |
| 指标难以量化、存在模糊语言 | 模糊综合评价 |
| 数据少、信息不完整 | 灰色关联分析 |
| 评价效率（投入→产出） | DEA |
| 指标多、高度相关、需降维 | PCA + TOPSIS |
| 同时需要主客观权重 | AHP + 熵权组合权重 |

### AHP 关键防错

- 判断矩阵维度超过 9×9 时一致性极难保证，建议拆成多级层次。
- 一致性指标 CR < 0.1 才通过；不通过必须调整矩阵，不能强行使用。
- 权重向量归一化后求和应为 1；最终得分 = 权重向量 × 方案矩阵，不是简单加法。
- 只能从已有方案中选优，不能自动生成新方案。

### 熵权法关键防错

- 若某指标所有方案取值完全相同，熵权为 0（该指标无区分度），属于正常结果，不是代码错误。
- 熵权忽略了指标本身业务重要性，数据离散度高的指标不一定业务上更重要；必要时用 AHP+熵权组合。
- 标准化方式要统一正负向：正向指标 (x - min)/(max - min)，负向指标 (max - x)/(max - min)；标准化后所有值应在 [0, 1]。

### TOPSIS 关键防错

- 必须有 2 个以上方案才能使用。
- 欧氏距离对量纲敏感，必须先标准化再计算距离。
- 贴近度 C = D⁻/(D⁺ + D⁻)，越接近 1 越优；C 值本身不是百分制得分，不要直接乘以 100 展示。
- 指标间高度相关时 TOPSIS 会重复计数，此时用 PCA 降维后再做 TOPSIS。

### 模糊综合评价关键防错

- 隶属度函数形状（三角形、梯形、高斯）要根据问题语义选择，不要默认用同一种。
- 合成算子通常选 M(·, +)（加权平均型），不要用 M(∧, ∨)（主因素突出型），后者会丢失大量信息。
- 指标集维数过大时结果分辨率下降（超模糊现象），应用二级模糊综合评价分层处理。

---

## 预测类模型详细指南

### 模型选型对照

| 模型 | 适用数据量 | 适用场景 | 主要限制 |
| --- | --- | --- | --- |
| GM(1,1) 灰色预测 | 4～15 个数据点 | 短期、近似指数增长趋势 | 不适合长期或震荡数据 |
| 线性回归 | 30+ | 变量间线性关系，需解释系数 | 无法捕捉非线性 |
| 岭/Lasso 回归 | 30+ | 多重共线性，高维特征选择 | Lasso 在强相关变量间不稳定 |
| ARIMA | 50+ | 平稳或可差分的单变量时序 | 不能直接处理多变量 |
| SARIMA | 50+ | 有季节性的时序 | 季节周期必须预先指定 |
| 指数平滑 | 10+ | 中短期、数据量少 | 长期趋势或复杂非线性表现差 |
| 随机森林回归 | 100+ | 非线性、多特征 | 外推能力弱，不适合长期预测 |
| XGBoost | 100+ | 非线性、需特征重要性 | 需调参，过拟合风险 |
| LSTM | 1000+ | 长序列时序，复杂非线性 | 数据量少时效果不稳定 |

### 时序预测关键防错

- 时序数据必须按时间顺序划分训练/验证集，不能随机打乱。
- 标准化 scaler 必须在训练集上 fit，再 transform 测试集；不能在全集上 fit。
- ARIMA 差分阶数 d 由 ADF 单位根检验确定；p、q 由 ACF/PACF 图或 AIC/BIC 准则确定。
- 灰色预测 GM(1,1) 只适合单调递增或近似指数增长序列；对震荡、递减序列预测失效。
- 预测结果要检查物理边界（人口不能为负，概率不超过 1，库存不能超上限）。

### 回归类关键防错

- 多重共线性检测：VIF > 10 说明严重共线，应用岭回归或删除高相关特征。
- 残差应满足正态分布、方差齐性、无自相关；违反时模型无效。
- 外推超出训练数据范围时预测可信度大幅下降，必须在论文中声明外推风险。

---

## 优化类模型详细指南

### 主要方法与适用规模

| 方法 | 适用规模 | 优点 | 缺点 |
| --- | --- | --- | --- |
| 线性规划 LP | 万级变量 | 全局最优，速度快 | 只支持线性目标和约束 |
| 整数规划 MIP | 百~千级变量 | 处理整数/0-1 变量 | NP-hard，规模大时极慢 |
| 非线性规划 NLP | 百级变量 | 支持非线性约束 | 容易陷入局部最优 |
| 动态规划 DP | 状态空间小时 | 最优子结构问题精确解 | 维度灾难 |
| 遗传算法 GA | 任意规模 | 不需要梯度，适合复杂约束 | 不保证全局最优，需调参 |
| 模拟退火 SA | 任意规模 | 逃出局部最优，实现简单 | 收敛慢，温度参数敏感 |
| 粒子群 PSO | 任意规模 | 连续空间效果好 | 离散变量需特殊处理 |
| NSGA-II | 多目标 | Pareto 前沿，标准多目标算法 | 目标数 > 3 时退化 |

### 优化建模关键防错

- 先写可行性约束，再考虑目标函数。一个没有可行解的模型比目标函数差的模型更致命。
- `scipy.optimize.minimize` 是最小化；最大化时目标函数取负，结果记录还原为正值。
- `scipy` 不等式约束形式是 `fun(x) >= 0`；写容量上限 `x <= C` 时应转化为 `C - x >= 0`。
- 整数约束：连续松弛后取整必须验证可行性；若不可行，用 branch-and-bound 或修复启发式。
- 启发式算法（GA/SA/PSO）必须：固定随机种子、多次独立运行（≥5 次）、报告结果均值和标准差、与精确算法或小规模精确解对比以证明可信度。
- 多目标问题不能直接加权相加不同量纲的目标；必须先独立归一化，再加权或做 Pareto 分析。

### 常见组合优化防错

- **TSP/VRP**：检查是否存在子回路（Miller-Tucker-Zemlin 约束或 lazy constraint）；VRP 还需检查容量约束和时间窗。
- **指派问题**：每个任务恰好分配给一个资源，每个资源最多承担一个任务；匈牙利算法适用于方阵，矩形情况需补虚拟行列。
- **背包问题**：注意 0-1 背包、有界背包、无界背包的区别；大规模时用 DP，超大规模用贪心+修复。
- **网络流**：最大流满足流量守恒和容量约束；最小费用最大流同时优化费用；负权边检查是否适合 Bellman-Ford。

---

## 机理/动力学类模型详细指南

### 常见微分方程模型

| 模型 | 核心方程 | 典型应用 |
| --- | --- | --- |
| Logistic 增长 | dx/dt = rx(1 - x/K) | 种群增长、市场渗透率、S 曲线预测 |
| SIR 传染病 | dS/dt、dI/dt、dR/dt 联立 | 疾病传播、谣言扩散、信息传播 |
| SEIR 扩展 | 增加潜伏期 E 仓室 | 有潜伏期的传染病 |
| Lotka-Volterra | 捕食者-猎物联立方程 | 生态系统、市场竞争 |
| 牛顿运动方程 | ma = F | 力学、弹道、振动 |

### 微分方程建模关键防错

- 状态变量必须有物理/业务含义，量纲要标注。
- 初始条件（t=0 时各变量取值）和边界条件（空间域边界）必须明确。
- 刚性系统（时间尺度差异大）用 `solve_ivp(method='Radau')` 或 `'BDF'`，不要用默认的 `'RK45'`。
- 检查守恒量：SIR 模型 S+I+R = N（常数）；能量守恒系统总能量应不增加（有耗散时单调递减）。
- 数值解的步长收敛性：将步长减半，结果变化小于 1% 才算收敛。
- 参数拟合时要分离训练期和验证期，不能用全部数据拟合再在同期验证。

### 随机/仿真类模型

- **蒙特卡洛**：采样次数通常需要 10,000 次以上才能使结果稳定；报告置信区间，不只报均值。
- **元胞自动机**：网格边界条件（周期性/固定/吸收）会显著影响结果，必须说明选择理由。
- **马尔可夫链**：状态转移矩阵每行之和必须为 1；稳态分布存在的条件是链不可约且非周期；瞬态分析要区分吸收态和瞬态。

---

## 图论与网络类模型

### 算法选型速查

| 问题类型 | 推荐算法 | 注意事项 |
| --- | --- | --- |
| 单源最短路（非负权）| Dijkstra | 负权边不可用 |
| 单源最短路（含负权）| Bellman-Ford | 时间复杂度 O(VE) |
| 全对最短路 | Floyd-Warshall | O(V³)，适合稠密图 |
| 最小生成树 | Prim / Kruskal | Prim 适合稠密图，Kruskal 适合稀疏图 |
| 最大流 | Ford-Fulkerson / Dinic | 容量必须非负 |
| 最小费用最大流 | MCMF (SPFA+增广) | 兼顾流量和费用 |
| TSP（精确）| 分支定界 / 动态规划 | 规模超 20 节点时计算量爆炸 |
| TSP（近似）| LKH / 遗传算法 | 近似比保证 |
| 二分图最大匹配 | 匈牙利算法 | 指派问题标准解法 |

### 图论防错

- 明确有向图还是无向图；有向图的入度和出度是不同概念。
- 最大流建模时，无向边需转化为两条方向相反、容量相同的有向边。
- TSP 问题必须检查 Hamiltonian 回路约束，禁止子回路。
- 网络流的流量守恒必须在每个中间节点成立：流入 = 流出。
- 节点数超过 1000 时，Floyd 算法的 O(V³) 不可接受，改用多次 Dijkstra。

---

## 统计分析与机器学习

### 统计检验速查

| 目的 | 推荐方法 | 适用条件 |
| --- | --- | --- |
| 两组均值差异 | t 检验 | 正态分布，方差齐性 |
| 多组均值差异 | 单因素 ANOVA | 正态分布，方差齐性 |
| 非参数两组比较 | Mann-Whitney U | 不要求正态分布 |
| 变量相关性 | Pearson（线性）/ Spearman（非线性）| Pearson 要求正态 |
| 分类变量独立性 | 卡方检验 | 期望频数 ≥ 5 |
| 时序平稳性 | ADF 单位根检验 | — |
| 正态性检验 | Shapiro-Wilk（小样本）/ K-S 检验 | — |

### 机器学习防错

- **过拟合防护**：训练集/验证集/测试集三分；验证集用于调参，测试集只评估最终模型，不能用测试集调参。
- **类别不平衡**：准确率 Accuracy 在不平衡数据下失效，改用 F1、AUC-ROC 或 Precision-Recall。
- **特征工程**：标准化/归一化的 scaler 必须在训练集 fit，不能在全集 fit；类别编码（One-Hot、Label Encoding）要在划分后做。
- **交叉验证**：时序数据不能用随机 K-Fold，必须用 TimeSeriesSplit。
- **特征重要性**：SHAP 值比随机森林的 feature_importances_ 更可靠，因为后者对相关特征有偏。

### 常用机器学习模型快速参考

| 模型 | 优点 | 缺点 | 典型用途 |
| --- | --- | --- | --- |
| 随机森林 | 抗过拟合，可解释特征重要性 | 外推能力弱 | 分类、回归、特征筛选 |
| XGBoost/GBDT | 精度高，处理缺失值 | 需调参，慢 | 竞赛首选，表格数据 |
| SVM | 小样本效果好，高维有效 | 大数据集慢，核函数选择难 | 分类，文本 |
| K-means | 简单快速 | 需指定 K，对初值敏感，不处理异形簇 | 聚类，分群 |
| DBSCAN | 自动发现簇数，处理噪声 | 高密度变化时表现差 | 异常检测，空间聚类 |
| Logistic 回归 | 可解释，输出概率 | 线性边界，特征需工程 | 二分类，风险评估 |

---

## 论文写作规范补充

### 摘要写作要点（中国赛/美赛通用）

- 摘要是评委最先也最重视的部分，应最后撰写（内容全部确定后）。
- 每个子问题必须覆盖：用了什么方法、建立了什么模型、主要结果是什么（含关键数值）。
- 不要出现复杂公式和表格；不要只重述题目；不要用"我们认为……""本文将……"等空泛表述。
- 中国赛摘要一般不超过两页，不需要翻译成英文。
- 美赛 Summary Sheet 是独立一页，应包含方法亮点、关键结论和模型创新点，不是摘要复制粘贴版。

### 论文结构完整性要点

完整的竞赛论文必须包含：
1. **摘要/Summary**：方法 + 结论 + 数值结果
2. **问题重述与分析**：不是照抄题面，而是建模者的理解和重新表达
3. **模型假设**：每条假设必须有必要性说明和在正文中的引用，不能是空洞罗列
4. **符号说明**：所有后文用到的符号在此定义，有量纲标注
5. **模型建立与求解**：每个子问题独立成节；先说明建模思路，再给出数学表达，再说明求解方法
6. **结果分析与检验**：数值结果 + 约束验证 + 误差分析
7. **灵敏度分析**：关键参数扰动时结果如何变化，说明模型鲁棒性
8. **模型评价与推广**：优缺点、改进方向、推广场景
9. **参考文献**：只引用真实存在的文献，格式规范

### 灵敏度分析规范

- 灵敏度分析不是可选项，是竞赛论文的必要内容。
- 方法：单参数扰动（±10%、±20%）观察目标函数变化；或 Tornado 图展示参数影响力排序。
- 对优化类问题：改变约束右端项或目标系数，观察最优解是否发生质变。
- 对预测类问题：改变关键假设或初始条件，观察预测曲线漂移幅度。
- 结论：若小扰动导致结果大幅变化，说明模型对该参数敏感，需在论文中声明。

### 常见写作错误（防错清单）

- 假设没有在正文建模处引用 → 假设形同虚设，评委质疑合理性。
- 结论只给数值，不解释含义 → "最优值为 1234.56"而不说明对应什么方案、有什么业务含义。
- 图表出现但正文没有引导和解释 → 评委不知道图要说明什么。
- 连续三张以上图表中间没有文字 → 论文变成图集。
- 公式符号首次出现处没有定义 → 读者无法理解模型。
- 参考文献是捏造或无法核实的 → 严重信誉问题。
- 摘要和正文数值不一致 → 摘要最后写、从正文复制数值可避免。

---

## 美赛（MCM/ICM）专项规范

### 2026 年重要规则

- 论文总页数限制为 **25 页**（含摘要、正文、参考文献、附录，不含 AI 使用声明附录）。
- 允许使用 LLM 和生成式 AI 工具，但必须在附录中明确标注使用范围和校验方式；该附录不计入 25 页。
- Summary Sheet 是独立必要页面，评委权重极高；内容应涵盖方法、亮点和关键结论。

### 美赛评分关键维度

- 假设的合理性：假设必须服务于建模，不能是凑数的废话。
- 建模的创造性：多模型对比、创新方法、非标准解法均加分。
- 结果的正确性与合理性：数值物理合理，约束不违反，限制情形下行为符合预期。
- 表述的清晰性：逻辑连贯、可视化专业、读者能复现。

### 美赛论文可视化要求

- 获奖论文图表占比通常高达 68%；纯文字论文很难获得高奖。
- 图表必须高清矢量格式（PDF/SVG/EPS），禁止截图模糊。
- 每张图必须有说明性 caption，并在正文中明确引用和解释。
- 颜色方案应在灰度打印下仍能区分，考虑色盲友好配色。

### 题型规律（历年 MCM/ICM 参考）

- **A 题（连续型）**：偏微分方程、物理/工程建模、优化；数学推导要求高。
- **B 题（离散型）**：图论、调度、组合优化、排队论；算法实现要求高。
- **C 题（数据洞察型）**：数据分析、机器学习、时序预测、可视化；数据处理能力要求高。
- **D/E/F 题（ICM）**：运筹学、可持续性、政策分析；跨学科和文字论证要求高。

### 高频"王炸"组合

| 问题类型 | 推荐组合 |
| --- | --- |
| 综合评价 | AHP + TOPSIS 或 AHP + 熵权 + TOPSIS |
| 预测 + 不确定性 | XGBoost/随机森林 + Bootstrap 置信区间 |
| 风险评估 | Logistic 回归 + 蒙特卡洛模拟 |
| 时空预测 | ARIMA/LSTM + 空间聚类 |
| 投资/资源优化 | 预测模型 + 动态规划/遗传算法 |
| 状态建模 | 马尔可夫链/HMM + 随机森林验证 |
| 文本分析（C 题）| TF-IDF + LDA 主题模型 + 情感分析 |
