能跑:为什么简单优先是最高原则
复杂度的代价不是「写的时候费劲」,是「改的时候绝望」。砍、硬、短——三个字讲透为什么在信息最少的阶段,简单不是偷懒,是降低意外概率。三个真实案例:Airflow过度设计、配置抽象过头、新产品验证把MVP做成平台。
复杂度的代价不是「写的时候费劲」,是「改的时候绝望」。砍、硬、短——三个字讲透为什么在信息最少的阶段,简单不是偷懒,是降低意外概率。三个真实案例:Airflow过度设计、配置抽象过头、新产品验证把MVP做成平台。
架构不是设计出来的,是在每个阶段做了正确的决策才长出来的。四阶段框架:能跑→跑得准→跑得稳→跑得快,每个阶段的核心矛盾不同,三条原则的权重随场景变化。
量化投资的核心是因子。因子是把选股逻辑翻译成一个可计算的数字,买入因子得分高的,卖出得分低的,回测看结果。这套流程表面上是数学,但背后有个更深层的问题:因子凭什么能工作? 因子不是真理,是假设 因子有效的前提,是市场存在可以被利用的规律。但如果市场完全有效,所有信息都即时反映在价格里,任何因子都没用
在进行量化回测时,如果对所有股票使用同一套因子组合,不仅意义不大,还会影响策略在单个股票上的表现,毕竟不同的股票有着不同的特点,不应当强行硬套所谓“四海皆准”的策略参数。因此,对股票进行粗筛分组很有必要,但前提是筛选和分组条件应当与后续策略的选择存在因果关系,否则很容易出现样本量太小而没有统计学意义
量化私募统治力越来越强,这是不争的事实。头部机构数据源铺到 Level 2、逐笔成交、另类数据,算力堆到几千台机器全天候跑回测,人才库塞满清北复交的数理博士。个人在这些维度上,没有一个能打。 但越是这样,我越要自己做。这笔账不是比谁强,而是算另一条逻辑。 钱在战场上就是生命。不管一个机构多优秀、多规
量化的本质是数据加因子加策略,数据质量决定策略的下限。但个人量化最容易被忽视的陷阱,是把策略研究变成工程量——建库、爬虫、维护数据源,本末倒置。自建数据源的坑还在其次,数据源怎么选,标准只有一个:这笔钱,赚得回来吗?
我经常被人说记性好。读过的书能复述个大概,见过的人隔了半年还能叫出名字,各种命令行和快捷键张嘴就来。 但我自己知道,我记性一点都不好。手机号码除了自己的,一个都背不出来。昨天中午吃了什么,要想三秒才想起来。上周答应过别人什么事,如果不写下来,忘得干干净净。 后来我琢磨明白了:我记住的那些东西,不是靠
发刊词:把三十六计当成决策模式来拆——每计都有成立条件、限制与代价;历史案例多是赢家写的,成功案例的光环之下,藏着没被写出来的前提。
Parquet、HDFS / 对象存储上的文件,写完就不能改。但业务总是要改 — 用户改了收货地址、订单从"待支付"变成"已发货"、某笔交易被风控标黑。 这些"改一行"的事情落到 Parquet 层,就变成了"重写整个文件"。 传统做法:Hive/Spark OVERWRITE 最直接的思路是 IN
Hudi 没有发明新存储格式,它站在 Parquet 和 Avro 之上。这不是"技术选型",而是刻意为之。 为什么用两种格式 Parquet 是列式文件,读的时候只扫需要的列,跳过滤掉的不读。一张 100 列的表查 3 个字段,Parquet 只读 3% 的数据。 Avro 是行式文件,一行一行写