大数据挑战赛第三次“月月星”公布,两支领先队伍分享量化建模与验证经验。
原文标题:快讯|2026大数据挑战赛月月星评选获奖队伍公布,附赛事经验分享!(第三次)
原文作者:数据派THU
冷月清谈:
“无糖可乐”团队将赛题拆解为数据构造、验证体系、排序模型和组合后处理,强调该任务并非简单预测个股涨跌,而是横截面排序与投资组合优化。他们使用StockTransformer建模单股时序特征和股票间相对强弱,并融合LightGBM LambdaRank、规则因子与协方差优化,通过滚动验证和审计脚本控制数据泄漏与提交风险。
“绫袅的团队”则分享了从特征堆叠到特征精简的过程。他们发现特征数量增加未必提升效果,最终通过IC分析、消融实验和相关性筛选,将特征压缩到20个,并采用Top-5等权持有一周收益作为验证指标。团队也指出纯量价模型难以覆盖政策、资金流等外部因素,后续正尝试将回归问题转为排序问题。
文章还提到赛事报名队伍已超过3000支,总人数突破4600人,报名截止时间为7月15日12:00。
怜星夜思:
2、在股票排序任务中,直接预测收益率和预测横截面排名,哪个更适合比赛场景?
3、特征工程里,为什么有时候特征越多,模型表现反而越差?
4、纯量价数据做股票预测的天花板在哪里?是否有必要引入新闻、政策、资金流等外部数据?
原文内容
2026中国高校计算机大赛-大数据挑战赛线上赛A阶段第三次月月星奖项评选环节开始啦,经过组委会对参赛队伍所提交模型和代码进行审核和复现后,荣获月月星的团队名单已出炉,恭喜获奖(每队发放奖金800元)的学生队伍!
目前榜单成绩最好的两支队伍在参赛中有哪些实战的经验呢?让我们一起围观他们的分享吧!
无糖可乐队伍
参赛经验分享
很荣幸能获得这本次经验分享的机会,我们团队此前有过数学建模竞赛经验,因此在参加本次大数据挑战赛时,第一反应不是马上堆模型,而是先把赛题拆成“数据构造、验证体系、排序模型、组合后处理”四个部分。赛题要求从沪深300成分股中选择不超过5只股票并分配权重,本质上不是简单预测某只股票涨跌,而是一个横截面排序与投资组合优化问题。
1.数据层面
我们整理了2015-01-05至2026-03-13的沪深300历史行情数据,共605859行,覆盖300只股票、2718个交易日。其中训练集604359行,测试集1500行。我们记录了Tencent、Baostock、AKShare等数据来源,并通过审计脚本检查股票池、日期范围和提交格式,避免数据泄漏和股票池漂移。
2.模型方面
我们的核心是`StockTransformer`。它的输入形状为:![]()
这套结构先用TransformerEncoder学习单只股票过去60个交易日的时序特征,再通过CrossStockAttention建模同一天不同股票之间的相对强弱,最后输出每只股票的排序分数。相比直接预测收益率,我们更重视Top5排序质量,因为最终成绩由组合收益决定。
3.特征工程
我们构建了158+39维特征体系,包括Alpha因子、技术指标、残差动量、EWMA风险、横截面排名等。训练阶段使用WeightedRankingLoss,同时结合listwise、pairwise和Top-k加权思想,让模型更关注最终可能进入组合的股票。
4.验证
我们借鉴数学建模中的稳健性思路,没有只看一次划分结果,而是做滚动窗口验证。当前模型质量报告中,我们的Top5收益分别为0.03739、0.04065、0.03173;表现较好的recent_stable_val202602模型Top5收益达到0.05808,selection_score达到0.18685。
5.总结
我们没有依赖单一模型提交,而是融合Transformer、LightGBM LambdaRank、规则因子和协方差组合优化。ensemble_predict.py中实现了hybrid_guard策略,用树模型候选池和Transformer高置信候选共同筛选,再控制单票权重和组合风险。整个流程通过competition_workflow.py audit自动检查result.csv格式、权重和、滚动验证与数据来源。
这次比赛最大的收获是:金融任务中,模型复杂度不等于最终收益。真正重要的是目标函数贴近赛题、验证体系可信、后处理稳健,以及每一步都能复现。
一、理解与数据
采用 LightGBM 预测个股未来一周收益率。初期从量价数据构造 97 个特征(收益率统计量、波动率、换手率、横截面百分位排名等),验证表现不升反降;扩充至 142 个后过拟合更严重。我们认识到:信号密度比数量更重要,LightGBM 对有效信息密度高度敏感。
后续经信息系数分析和消融实验,剔除 IC 长期不稳定或符号不一致的变量,并去除相关系数 >0.9 的冗余特征,最终精简至 20 个,集中于波动率、成交量、价格位置的截面排名,模型表现显著提升。
二、训练验证
前期我们使用NDCG作为验证指标,但发现其与最终评分相关性不强。于是直接改用 “Top‑5等权持有一周的平均收益” 作为模型选择的核心指标——试验过不同加权方式,收益提升有限,等权最为稳定。
严格按时序切分训练/验证集,留出 5 天空窗期避免标签泄漏。采用 LightGBM 回归,做 50 次滚动验证(每次向前滚动一周)。约 68% 的验证窗口收益为正,最长连续亏损 3 个窗口,但周收益率波动幅度达 10 个百分点,预测仍具偶然性。
三、调参与超参数
超参数通过两阶段搜索确定:1. 单参数扫描(学习率、num_leaves、lambda_l1、lambda_l2、feature_fraction),各参数取前3个较优值。2. 对候选值进行网格组合搜索,以验证集最终收益率为选择依据。
四、反思
模型预测的平均收益水平不高,且最好与最差周收益差距超过10个百分点。资金流向、政策事件等外部因素是纯量价模型难以捕捉的;尝试引入 Alpha158 因子库扩充特征后,过拟合反而加剧。
当前模型的主要不足:纯量价特征、等权权重、单模型、固定训练窗口。此外损失函数、样本权重等方面仍有优化空间。我们也尝试过神经网络及其他时序模型,但受限于样本量,难以平衡过拟合问题。
五、下一步
我们最近将回归目标转换为回归排序问题——预测个股未来一周收益在截面上的百分位等级,并将验证指标调整为所选5只股票的平均百分位排名。在50次滚动验证上,平均周收益远超此前均值,正收益窗口比例显著提升,最优窗口收益可达 10%+,且仍有较大优化空间。
大赛报名人数持续攀升!目前,已有来自高校和企事业单位的3000多支队伍参赛,报名总人数突破4600人。参赛选手可以下载数据在本地进行算法设计和调试,并通过竞赛平台提交结果文件及模型代码,报名截止至7月15日12:00。
每一次努力都值得被看见,每一份才华都值得被赞赏。让我们一起,用代码书写梦想,用数据描绘未来!
扫码观看大赛启动会回放
大赛官方渠道主要包括:
大赛官网:https://nercbds.tsinghua.edu.cn/bdc.html
大赛邮箱:data@tsinghua.edu.cn
大赛QQ群:112186245 / 759142692/762146461
欢迎点击原文,了解更多大赛详情
往期回顾
关于我们



