Premium

面向交易的机器学习
无需编写 Python。

可视化声明式流水线:拖拽、连接、配置。特征工程、时间交叉验证、超参数调优和部署——全部在同一个应用中,全部可组合。

Verida ML pipeline: visual declarative DAG with feature engineering, training and validation

Verida ML — visual declarative DAG, from raw data to materialized prediction

流水线流程

从原始数据到作为实时指标物化预测。

1
原始序列(OHLCV)
2
特征工程(滞后、变换、日历)
3
插补 + 异常值去除 + 方差阈值
4
相关性过滤
5
分割(walk-forward,时间序列)
6
训练(gbdt、mlp、随机森林、质心、knn 或自定义)
7
验证(准确率、F1、混淆矩阵、回测)
8
预测物化为指标(ct://derived/...)

模型后端

内置或自定义。框架与算法无关。

梯度提升

gbdt

集成决策树。稳健,处理非线性。通过 scikit-learn。

MLP

mlp

多层神经网络。通过 PyTorch。灵活适用于复杂模式。

随机森林

random_forest

独立树的集成。降低方差,抗过拟合。

质心

centroide

质心距离分类器。简单、可解释、无外部依赖。

KNN

knn

K 近邻。按特征空间中的邻近度分类。

K-Means

kmeans

无监督聚类。无标签分组模式,适用于市场状态。

Isolation Forest

isolation_forest

异常检测。无需先验标注即可识别异常值。

线性

linear

线性回归/分类。可解释的基线,训练快速。

+ 通过内联 Python 脚本自定义后端——定义 treinar/inferir 并使用任何库。

DAG 组件

每个节点是一次变换。按你的意愿组合。

特征工程

滞后、变换(log、sqrt、retorno_pct)、交互(比率、乘积、差值)。

日历特征

日内小时、周内日期、周期性的正弦编码。

插补

NaN 填充(均值、中位数、零、ffill、bfill)。因果性的,无前瞻。

异常值去除

按经验分位数裁剪。去除极端值而不扭曲分布。

方差阈值

丢弃零方差特征。消除不含信息的列。

相关性过滤

按与目标的相关性保留 top-k 特征。降低多重共线性。

交叉验证

时间序列 k 折、walk-forward(扩展或滚动),含禁运。

超参数调优

网格搜索或随机搜索,含排名指标评估。

标注

标注为方向(+1/0/-1)、连续回报或分类组合。

ML 不是神谕

流水线在历史数据上优化。比直觉好吗?也许。比手动过拟合好吗?当然。能预测未来吗?不能。市场是不可知的。

ML 做的:在过去中找模式。你做的:决定那些模式是否重要。