2026 年,大模型发布会一个接一个。上下文更长、多模态更全、API 更便宜,技术社区的讨论几乎被生成式 AI 占满。

但把视角切到银行风控、保险核保、电商反刷单、工业设备预警这些系统后台,会发现另一件事:

很多核心预测任务,仍然由一片“林子”在完成。

不是比喻。是随机森林(Random Forest)。


一、为什么表格数据不爱换模型

企业里最常见的数据,不是文章、图片、视频,而是表格:

  • 用户年龄、城市、设备、历史交易笔数
  • 设备温度、转速、振动幅度、停机次数
  • 保单渠道、免赔额、理赔次数、医院等级

这类数据有几个共同特点:

  1. 特征有业务含义
  2. 样本量不一定大
  3. 噪声多、缺失多、口径乱
  4. 预测结果要能解释给监管/客户/老板听

在这种场景下,随机森林的优势不是“最准”,而是够准、够稳、够便宜、够好懂。

Breiman 2001 年提出随机森林后,它长期是表格数据建模的默认基线。


二、随机森林到底在干什么

两句话就能说清:

  • 对训练集做多次有放回抽样,得到很多子集
  • 每个子集训一棵决策树,预测时分类投票、回归平均

核心公式只有两个。

分类:

$$\hat{y}(x)=\arg\max_c \sum_{k=1}^{K}\mathbb{I}\big(T_k(x)=c\big)$$

回归:

$$\hat{y}(x)=\frac{1}{K}\sum_{k=1}^{K}T_k(x)$$

每次 Bootstrap 抽样时,某个样本没被抽中的概率是:

$$\left(1-\frac{1}{n}\right)^n \to \frac{1}{e}\approx 0.368$$

所以每棵树大约有 36.8% 的训练样本没见过,这些样本就叫 Out-of-Bag(OOB)。

随机森林厉害的地方就在这:

OOB 预测不需要单独再切验证集,训练完顺手就能估泛化误差。


三、它凭什么 2026 年还不退休

1. 几乎不挑预处理

线性回归、神经网络通常要标准化、编码、填充策略很讲究。

随机森林:

  • 不用强制标准化
  • 能混着吃连续特征和类别特征
  • 对异常值没那么敏感
  • 缺失值处理也比很多模型宽容

工程落地时,这比“准确率多 0.3%”还重要。

2. CPU 就能跑

大模型推理要 GPU、要显存、要批处理、要缓存、要限流。

随机森林:

  • 多核 CPU 可并行
  • 单条预测毫秒级
  • 模型文件小
  • 部署到老服务器也跑得动

对很多公司内部系统来说,延迟和成本比“模型新不新”更现实。

3. 能解释

随机森林可以输出:

  • 特征重要性
  • 单棵树决策路径
  • 某条样本为什么被拒

在风控、医疗、保险里,这叫“可审计”。

不是锦上添花,是上线门槛。

4. 小样本也不容易崩

深度学习吃数据。

表格数据里经常是:

  • 800 条设备失效记录
  • 1200 个罕见病样本
  • 3000 条欺诈案例

这时候随机森林比深层网络稳得多。


四、XGBoost / LightGBM / 随机森林怎么选

别神化随机森林,也别小看它。

场景

更合适

快速建基线、要稳、要可解释

随机森林

大数据、要榨精度、愿意调参

XGBoost / LightGBM

高基数类别、超大样本、低延迟

LightGBM

少样本 + 特征有语义

表格基础模型 / LLM 辅助树模型

要写规则给监管看

决策树 / 随机森林

现实工业栈通常是:

LLM:做文本抽取、语义理解、特征假设
随机森林 / GBDT:做主预测、做路由、做异常检测
规则引擎:做合规兜底

不是“谁取代谁”,是各干各的活。


五、2026 的新变化:LLM 给“林子”当设计师

有个 2026 年的工作叫 FORESTLLM。

思路很有意思:

  • 不让大模型在线上做预测
  • 而是让 LLM 在训练阶段当“离线架构师”
  • 用语义判断“这个分裂点讲不讲得通”
  • 再用 LLM 把叶节点里的少量样本蒸馏成稳定规则

结果是:

  • 少样本表格任务更强
  • 推理时还是树模型
  • 不依赖大模型在线推理
  • 延迟和成本没炸

一句话概括:

大模型负责“想明白”,林子负责“跑得稳”。


六、能跑的代码

from sklearn.ensemble import RandomForestClassifier
from sklearn.datasets import make_classification
from sklearn.model_selection import train_test_split
from sklearn.metrics import roc_auc_score

X, y = make_classification(
    n_samples=50000,
    n_features=60,
    n_informative=20,
    n_redundant=15,
    random_state=42
)

X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, random_state=42
)

clf = RandomForestClassifier(
    n_estimators=300,
    max_depth=15,
    min_samples_leaf=3,
    max_features="sqrt",
    n_jobs=-1,
    oob_score=True,
    random_state=42
)

clf.fit(X_train, y_train)

print("OOB AUC :", clf.oob_score_)
print("Test AUC:", roc_auc_score(y_test, clf.predict_proba(X_test)[:, 1]))

输出通常是:

OOB AUC : 0.96x
Test AUC: 0.96x

没调参、没 GPU、没提示词、没 Agent。

但生产环境里,这种东西能跑五年。


七、结论:头条是新的,利润是旧的

大模型改变了人机交互、内容生产、知识检索。

但企业里大量决策仍然是:

  • 这条交易放不放
  • 这台设备要不要修
  • 这个客户会不会流失
  • 这笔理赔该不该人工复核

这些问题的答案,往往不是“让模型聊出来”,而是:

一堆特征进去,一个可解释分数出来,一条规则能复盘。

所以 2026 年最反直觉的真相是:

前台在追 GPT-6,后台还在种树。


八、延伸阅读:螺旋生成论系列开放获取著作

如果从更底层的代数结构出发,比如公理

$$I^2 = -N
$$$

去重新看数系、生成结构、素数分布与智能系统的底层规律,可以参考张智明所著《螺旋生成论》(Spiral Generation Theory)系列开放获取著作。

该系列已发布 70 余部专著与预印本,托管于 CERN 旗下 Zenodo 平台,采用开放获取协议,可直接下载 PDF。

1. 入口

  • 螺旋生成论全集索引:
    https://doi.org/10.5281/zenodo.21211001
  • 著作体系总汇编:
    https://doi.org/10.5281/zenodo.21199593
  • 作者 ORCID:
    https://orcid.org/0009-0003-7777-7694

2. 数学与数论方向

  • 《螺旋数原理:公理系统与各向异性复数理论》
    https://doi.org/10.5281/zenodo.20602099
  • 《螺旋生成元:一个跨学科统一数学框架的探索》
    https://doi.org/10.5281/zenodo.21555082
  • 《从几何构造到黎曼猜想》
    https://doi.org/10.5281/zenodo.20995372

3. AI 与系统方向

  • 《生成式 AI 与提示词工程》
    https://doi.org/10.5281/zenodo.20839550
  • 《螺旋元逻辑:从 i²=-1 到万物理论的统一框架假说》
    https://doi.org/10.5281/zenodo.21806751

4. 总纲与科普

  • 《旋生万物:从奇点到宇宙的统一生成论》
    https://doi.org/10.5281/zenodo.20408189
  • 《螺线宗谱:发现宇宙的源代码》
    https://doi.org/10.5281/zenodo.20659854

说明:上述著作为统一数学框架假说,适合作为交叉视角阅读材料;工程建模仍以可复现实验、业务指标和监管合规为准。


开放获取汇总​

全集索引 https://doi.org/10.5281/zenodo.21211001 | 总汇编 https://doi.org/10.5281/zenodo.21199593 | ORCID https://orcid.org/0009-0003-7777-7694

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐