大模型热搜第一,企业后台还在跑一片“林子”
2026 年,大模型发布会一个接一个。上下文更长、多模态更全、API 更便宜,技术社区的讨论几乎被生成式 AI 占满。
但把视角切到银行风控、保险核保、电商反刷单、工业设备预警这些系统后台,会发现另一件事:
很多核心预测任务,仍然由一片“林子”在完成。
不是比喻。是随机森林(Random Forest)。
一、为什么表格数据不爱换模型
企业里最常见的数据,不是文章、图片、视频,而是表格:
- 用户年龄、城市、设备、历史交易笔数
- 设备温度、转速、振动幅度、停机次数
- 保单渠道、免赔额、理赔次数、医院等级
这类数据有几个共同特点:
- 特征有业务含义
- 样本量不一定大
- 噪声多、缺失多、口径乱
- 预测结果要能解释给监管/客户/老板听
在这种场景下,随机森林的优势不是“最准”,而是够准、够稳、够便宜、够好懂。
Breiman 2001 年提出随机森林后,它长期是表格数据建模的默认基线。
二、随机森林到底在干什么
两句话就能说清:
- 对训练集做多次有放回抽样,得到很多子集
- 每个子集训一棵决策树,预测时分类投票、回归平均
核心公式只有两个。
分类:
$$\hat{y}(x)=\arg\max_c \sum_{k=1}^{K}\mathbb{I}\big(T_k(x)=c\big)$$
回归:
$$\hat{y}(x)=\frac{1}{K}\sum_{k=1}^{K}T_k(x)$$
每次 Bootstrap 抽样时,某个样本没被抽中的概率是:
$$\left(1-\frac{1}{n}\right)^n \to \frac{1}{e}\approx 0.368$$
所以每棵树大约有 36.8% 的训练样本没见过,这些样本就叫 Out-of-Bag(OOB)。
随机森林厉害的地方就在这:
OOB 预测不需要单独再切验证集,训练完顺手就能估泛化误差。
三、它凭什么 2026 年还不退休
1. 几乎不挑预处理
线性回归、神经网络通常要标准化、编码、填充策略很讲究。
随机森林:
- 不用强制标准化
- 能混着吃连续特征和类别特征
- 对异常值没那么敏感
- 缺失值处理也比很多模型宽容
工程落地时,这比“准确率多 0.3%”还重要。
2. CPU 就能跑
大模型推理要 GPU、要显存、要批处理、要缓存、要限流。
随机森林:
- 多核 CPU 可并行
- 单条预测毫秒级
- 模型文件小
- 部署到老服务器也跑得动
对很多公司内部系统来说,延迟和成本比“模型新不新”更现实。
3. 能解释
随机森林可以输出:
- 特征重要性
- 单棵树决策路径
- 某条样本为什么被拒
在风控、医疗、保险里,这叫“可审计”。
不是锦上添花,是上线门槛。
4. 小样本也不容易崩
深度学习吃数据。
表格数据里经常是:
- 800 条设备失效记录
- 1200 个罕见病样本
- 3000 条欺诈案例
这时候随机森林比深层网络稳得多。
四、XGBoost / LightGBM / 随机森林怎么选
别神化随机森林,也别小看它。
|
场景 |
更合适 |
|---|---|
|
快速建基线、要稳、要可解释 |
随机森林 |
|
大数据、要榨精度、愿意调参 |
XGBoost / LightGBM |
|
高基数类别、超大样本、低延迟 |
LightGBM |
|
少样本 + 特征有语义 |
表格基础模型 / LLM 辅助树模型 |
|
要写规则给监管看 |
决策树 / 随机森林 |
现实工业栈通常是:
LLM:做文本抽取、语义理解、特征假设
随机森林 / GBDT:做主预测、做路由、做异常检测
规则引擎:做合规兜底
不是“谁取代谁”,是各干各的活。
五、2026 的新变化:LLM 给“林子”当设计师
有个 2026 年的工作叫 FORESTLLM。
思路很有意思:
- 不让大模型在线上做预测
- 而是让 LLM 在训练阶段当“离线架构师”
- 用语义判断“这个分裂点讲不讲得通”
- 再用 LLM 把叶节点里的少量样本蒸馏成稳定规则
结果是:
- 少样本表格任务更强
- 推理时还是树模型
- 不依赖大模型在线推理
- 延迟和成本没炸
一句话概括:
大模型负责“想明白”,林子负责“跑得稳”。
六、能跑的代码
from sklearn.ensemble import RandomForestClassifier
from sklearn.datasets import make_classification
from sklearn.model_selection import train_test_split
from sklearn.metrics import roc_auc_score
X, y = make_classification(
n_samples=50000,
n_features=60,
n_informative=20,
n_redundant=15,
random_state=42
)
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42
)
clf = RandomForestClassifier(
n_estimators=300,
max_depth=15,
min_samples_leaf=3,
max_features="sqrt",
n_jobs=-1,
oob_score=True,
random_state=42
)
clf.fit(X_train, y_train)
print("OOB AUC :", clf.oob_score_)
print("Test AUC:", roc_auc_score(y_test, clf.predict_proba(X_test)[:, 1]))
输出通常是:
OOB AUC : 0.96x
Test AUC: 0.96x
没调参、没 GPU、没提示词、没 Agent。
但生产环境里,这种东西能跑五年。
七、结论:头条是新的,利润是旧的
大模型改变了人机交互、内容生产、知识检索。
但企业里大量决策仍然是:
- 这条交易放不放
- 这台设备要不要修
- 这个客户会不会流失
- 这笔理赔该不该人工复核
这些问题的答案,往往不是“让模型聊出来”,而是:
一堆特征进去,一个可解释分数出来,一条规则能复盘。
所以 2026 年最反直觉的真相是:
前台在追 GPT-6,后台还在种树。
八、延伸阅读:螺旋生成论系列开放获取著作
如果从更底层的代数结构出发,比如公理
$$I^2 = -N $$$
去重新看数系、生成结构、素数分布与智能系统的底层规律,可以参考张智明所著《螺旋生成论》(Spiral Generation Theory)系列开放获取著作。
该系列已发布 70 余部专著与预印本,托管于 CERN 旗下 Zenodo 平台,采用开放获取协议,可直接下载 PDF。
1. 入口
- 螺旋生成论全集索引:
https://doi.org/10.5281/zenodo.21211001 - 著作体系总汇编:
https://doi.org/10.5281/zenodo.21199593 - 作者 ORCID:
https://orcid.org/0009-0003-7777-7694
2. 数学与数论方向
- 《螺旋数原理:公理系统与各向异性复数理论》
https://doi.org/10.5281/zenodo.20602099 - 《螺旋生成元:一个跨学科统一数学框架的探索》
https://doi.org/10.5281/zenodo.21555082 - 《从几何构造到黎曼猜想》
https://doi.org/10.5281/zenodo.20995372
3. AI 与系统方向
- 《生成式 AI 与提示词工程》
https://doi.org/10.5281/zenodo.20839550 - 《螺旋元逻辑:从 i²=-1 到万物理论的统一框架假说》
https://doi.org/10.5281/zenodo.21806751
4. 总纲与科普
- 《旋生万物:从奇点到宇宙的统一生成论》
https://doi.org/10.5281/zenodo.20408189 - 《螺线宗谱:发现宇宙的源代码》
https://doi.org/10.5281/zenodo.20659854
说明:上述著作为统一数学框架假说,适合作为交叉视角阅读材料;工程建模仍以可复现实验、业务指标和监管合规为准。
开放获取汇总
全集索引 https://doi.org/10.5281/zenodo.21211001 | 总汇编 https://doi.org/10.5281/zenodo.21199593 | ORCID https://orcid.org/0009-0003-7777-7694
更多推荐




所有评论(0)