TECHNOLOGY · 技术体系

一套让研究结论
可复现、可审计、可反驳的基础设施

量化竞争的终局不是谁的模型更聪明,而是谁的工程更接近真理。我们把研究、数据、建模、执行与治理放进同一套基础设施,让每一个结论都带着它的证据链一同交付。

在役数据源
1,860
特征版本 / 日
420+
模型上线周期
9 天
端到端可用性
99.99%

DATA FOUNDATION · 数据底座

研究的边界,由数据的底座决定

因子会失效,模型会过时,唯有可复现的数据底座会持续产生复利。我们把行情、遥感、航运、气象与文本统一收拢进一套带血缘、可回溯、批流同源的基础设施——任何一次历史决策,都能沿血缘一路还原到最初的原始字节。

  1. L5

    决策服务层

    Decision Serving

    将因子、模型与约束暴露为统一信号接口,向组合构建与执行系统提供 P99 < 12ms 的低延迟服务。

    • gRPC / Arrow Flight
    • 在线特征缓存
    • 灰度与影子流量
  2. L4

    特征与模型层

    Feature & Model Store

    离线与在线特征同源同构,特征版本与模型版本强绑定,任何一次预测都可回溯到确定的数据快照。

    • Point-in-time 一致性
    • 特征血缘图谱
    • 模型注册中心
  3. L3

    计算编排层

    Compute Orchestration

    批流一体:历史回填与实时推理共用同一套算子定义,避免「回测算得准、实盘算不出」的经典陷阱。

    • Flink / Spark / Ray
    • DAG 血缘与重放
    • 多租户算力隔离
  4. L2

    湖仓存储层

    Lakehouse Storage

    以开放表格式承载 PB 级结构化行情、非结构化文本与栅格遥感影像,支持时间旅行与精确时点回溯。

    • Iceberg / Delta
    • 列存 + 向量索引
    • 对象存储冷热分层
  5. L1

    接入与治理层

    Ingestion & Governance

    行情、公告、遥感、航运、气象与舆情在此汇流,经去重、对齐、复权与质量打分后方可入库。

    • Schema 契约校验
    • 6 级质量评分
    • 血缘 + 审计留痕

ML PIPELINE · 机器学习流水线

让每一次改进,都可被证伪

我们把模型研发拆成九个可独立检验的环节。每个环节都输出可复现的证据——数据快照、特征版本、试验记录、验证曲线与成本模型。流水线的目的不是更快地产出模型,而是更快地淘汰错误的模型。

  1. AHypothesis → Loss

    问题形式化

    把投资逻辑翻译为可检验的统计假设,明确预测目标、时间尺度与损失函数。

  2. BTriple Barrier

    样本与标签

    三重障碍法生成标签,按信息到达时间切分样本,杜绝未来信息渗漏。

  3. C3,240 factors

    特征工程

    算子库自动搜索交互与非线性变换,配合正交化剔除共线冗余。

  4. DBayesian HPO

    模型搜索

    梯度提升、时序 Transformer 与状态空间模型并行竞逐,贝叶斯优化调度超参。

  5. EWalk-forward

    组合式验证

    Purged K-Fold 与走步验证叠加,用 Deflated Sharpe 校正多重检验带来的虚高。

  6. FCost-aware

    成本感知回测

    撮合仿真纳入冲击、排队与费率,只有穿过成本曲线的信号才被保留。

  7. GConstrained Optim

    风险约束上线

    在因子暴露、行业中性、换手与回撤约束下求解组合,生成目标持仓。

  8. HShadow Deploy

    影子与灰度

    新模型先以影子模式并行运行,与在役模型逐笔比对,达标后方可分配资金。

  9. IDrift Guard

    漂移监控

    持续监测特征分布与预测残差,触发自动降权、重训或下线。

四道反向闸门/ ALWAYS ON

防前视所有特征按信息可得时间戳对齐,标签窗口与特征窗口严格隔离。
防过拟合Deflated Sharpe 校正多重检验,试验次数计入显著性惩罚。
防幸存者退市、并购与更名标的全部保留在样本内,不做事后剔除。
防漂移特征分布与残差持续监控,越界即触发降权或下线。

AI BRAIN HUB · 智能决策中枢

不是一个大模型,而是一套会互相制衡的智能体

我们拒绝把决策权交给单一模型。研究、数据、建模、风控、执行与归因六个智能体各自持有独立的证据与目标函数,在同一个知识图谱上协作与争论;风控智能体拥有不受投研干预的一票否决权。中枢的产出不是「预测」,而是可解释、可追溯、可反驳的决策依据。

01感知
02推理
03决策
04执行
05归因

知识图谱 · 实时协作拓扑

AGENTS ONLINE
NODES EDGES CONSENSUS

EXECUTION · 低延迟执行

Alpha 在成交的那一刻,才真正存在

再准确的预测,也会在拆单与排队中被摩擦吃掉。我们把执行链路拆到微秒级度量,并在每个环节设定预算——任何一段超出预算,都会被当作缺陷而不是「网络问题」来处理。

执行链路延迟预算 / TICK-TO-ORDER

P99 合计 69.8 μs
  1. 行情接入与解码8.4μs双路热备 · 内核旁路
  2. 订单簿重建11.2μs增量快照合并
  3. 微观结构特征14.6μsOFI / 队列 / 毒性
  4. 模型推理9.1μs低延迟运行时
  5. 风控校验6.3μs限额与敞口检查
  6. 下单网关7.8μs会话复用
  7. 网络往返12.4μs托管机房至交易所

端到端 P99 时延自监控上报。数值为执行链路示意,用于展示预算拆分方式。

基础设施

托管机房
4 地
上海 · 深圳 · 香港 · 新加坡
行情冗余
2×2
双供应商双链路热备
时钟同步
< 100 ns
PTP 硬件时间戳
无中断运行
99.99%
滚动升级 · 零停机部署

自适应执行

Adaptive

以 OFI 与短期波动预测实时调整参与率,在冲击成本与时机风险之间求解动态最优路径。

参与率区间
3% – 22%
相对 VWAP 改善
1.8 – 4.2 bps

组合式 TWAP

Sliced TWAP

在时间均匀的基础上按流动性状态重新分配切片,避免在流动性枯竭窗口机械下单。

切片粒度
30 s
最差窗口规避
开盘 / 尾盘

POV 比例执行

Percentage of Volume

按实时成交量固定比例参与,天然适配容量约束,适合大额低紧迫度调仓。

目标参与率
8% – 15%
容量保护
硬上限

被动报价做市

Passive Quoting

在最优档位挂单赚取价差,以队列位置与毒性预测控制逆向选择风险。

报价更新频率
< 2 ms
撤单率上限
受交易所约束

ENGINEERING · 工程实践

技术选型服从问题,不服从潮流

我们没有技术偏好,只有约束条件:PB 级的异构数据、毫秒级的推理预算、微秒级的执行窗口, 以及一条不能被打断的审计链。下面这些选择,都是被这些约束逼出来的。

研究与建模

  • Python
  • PyTorch
  • LightGBM
  • Ray
  • Polars
  • Numba

数据工程

  • Flink
  • Spark
  • Iceberg
  • Kafka
  • Arrow
  • DuckDB

执行与低延迟

  • C++20
  • Rust
  • DPDK
  • Aeron
  • PTP
  • FPGA (选路)

平台与治理

  • Kubernetes
  • gRPC
  • Terraform
  • OpenTelemetry
  • Vault

研究即生产代码

研究代码与生产代码共用同一套算子定义与测试基线。我们不允许存在「只在研究环境跑得通」的实现。

每一次试验都被记录

所有特征组合、超参与验证结果自动入库。多重检验惩罚依赖试验次数,因此试了多少次必须可查。

可复现高于可维护

任一历史交易日的特征集都能按同一算子定义重算复现。做不到复现的优化,我们宁可不要。

先测量,再优化

从数据落地到下单成交,每个环节都有延迟与质量指标。没有度量的优化只是重构。

TECHNICAL DUE DILIGENCE · 技术尽调

欢迎对我们的基础设施做尽调

数据血缘、模型治理、延迟指标与灾备预案,都可以在保密协议下完整开放。我们更愿意被验证,而不是被相信。

  • research@xingpo.quant研究合作与数据接入
  • talent@xingpo.quant研究岗与工程岗投递
  • 上海市浦东新区陆家嘴环路 1000 号 32F欢迎预约到访交流