Launch HN: EdotEnv (YC S26) – 用于教授 LLMs 研究的量化交易 RL 环境
Hacker News2026年8月4日 18:36
强化学习环境 我们构建基于市场的 RL 环境,以教导智能体应用机器学习和在对抗噪声下的长远规划。静态合成基准不切实际且迅速饱和,而市场则是不饱和且自我改进的。 论点 静态世界产生静态智能 量化是最难但可解决的数据科学任务。 我们在由真实市场数据构建的环境中以编程方式生成量化研究任务。智能体使用专业工具——并在 Bash 中构建自己的工具——做出交易决策并开发盈利策略。市场不饱和:成功的交易使其更高效,同时边际效应衰减和制度发生变化。这使我们的环境成为不断困难的基准,以改善模型。 视野 决策不是一个瞬间 交易决策影响不止一步的未来。成功交易意味着多步骤规划,并评估短期和长期收益之间的权衡。 T+00 选择 在部分信息下采取行动。模型看到不完整的状态,并在完全后果可观察之前做出承诺。 T+18H 复合 该决策成为环境的一部分。风险敞口、机会成本和未采取的每一个行动都重塑后续的路径。 T+53H 重新评估 目标移动。一个决策可以在局部保持正确,同时在条件变化时变得全球昂贵。 T+96H 适应 行之有效的政策已过期。成功属于那些在昨天的行为成为共识之前,能够识别新制度的模型。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡