Premium 面向交易的机器学习
面向交易的机器学习
无需编写 Python。
可视化声明式流水线:拖拽、连接、配置。特征工程、时间交叉验证、超参数调优和部署——全部在同一个应用中,全部可组合。
Verida ML — visual declarative DAG, from raw data to materialized prediction
流水线流程
从原始数据到作为实时指标物化预测。
1
原始序列(OHLCV)
2
特征工程(滞后、变换、日历)
3
插补 + 异常值去除 + 方差阈值
4
相关性过滤
5
分割(walk-forward,时间序列)
6
训练(gbdt、mlp、随机森林、质心、knn 或自定义)
7
验证(准确率、F1、混淆矩阵、回测)
8
预测物化为指标(ct://derived/...)
模型后端
内置或自定义。框架与算法无关。
梯度提升
gbdt 集成决策树。稳健,处理非线性。通过 scikit-learn。
MLP
mlp 多层神经网络。通过 PyTorch。灵活适用于复杂模式。
随机森林
random_forest 独立树的集成。降低方差,抗过拟合。
质心
centroide 质心距离分类器。简单、可解释、无外部依赖。
KNN
knn K 近邻。按特征空间中的邻近度分类。
K-Means
kmeans 无监督聚类。无标签分组模式,适用于市场状态。
Isolation Forest
isolation_forest 异常检测。无需先验标注即可识别异常值。
线性
linear 线性回归/分类。可解释的基线,训练快速。
+ 通过内联 Python 脚本自定义后端——定义 treinar/inferir 并使用任何库。
DAG 组件
每个节点是一次变换。按你的意愿组合。
特征工程
滞后、变换(log、sqrt、retorno_pct)、交互(比率、乘积、差值)。
日历特征
日内小时、周内日期、周期性的正弦编码。
插补
NaN 填充(均值、中位数、零、ffill、bfill)。因果性的,无前瞻。
异常值去除
按经验分位数裁剪。去除极端值而不扭曲分布。
方差阈值
丢弃零方差特征。消除不含信息的列。
相关性过滤
按与目标的相关性保留 top-k 特征。降低多重共线性。
交叉验证
时间序列 k 折、walk-forward(扩展或滚动),含禁运。
超参数调优
网格搜索或随机搜索,含排名指标评估。
标注
标注为方向(+1/0/-1)、连续回报或分类组合。
ML 不是神谕
流水线在历史数据上优化。比直觉好吗?也许。比手动过拟合好吗?当然。能预测未来吗?不能。市场是不可知的。
ML 做的:在过去中找模式。你做的:决定那些模式是否重要。