2026大数据挑战赛第三次“月月星”公布:两支领先队伍分享量化建模经验

大数据挑战赛第三次“月月星”公布,两支领先队伍分享量化建模与验证经验。

原文标题:快讯|2026大数据挑战赛月月星评选获奖队伍公布,附赛事经验分享!(第三次)

原文作者:数据派THU

冷月清谈:

2026中国高校计算机大赛—大数据挑战赛线上赛A阶段第三次“月月星”评选结果公布,获奖学生队伍每队获得800元奖金。文章重点分享了当前榜单表现较好的两支队伍的实战思路。

“无糖可乐”团队将赛题拆解为数据构造、验证体系、排序模型和组合后处理,强调该任务并非简单预测个股涨跌,而是横截面排序与投资组合优化。他们使用StockTransformer建模单股时序特征和股票间相对强弱,并融合LightGBM LambdaRank、规则因子与协方差优化,通过滚动验证和审计脚本控制数据泄漏与提交风险。

“绫袅的团队”则分享了从特征堆叠到特征精简的过程。他们发现特征数量增加未必提升效果,最终通过IC分析、消融实验和相关性筛选,将特征压缩到20个,并采用Top-5等权持有一周收益作为验证指标。团队也指出纯量价模型难以覆盖政策、资金流等外部因素,后续正尝试将回归问题转为排序问题。

文章还提到赛事报名队伍已超过3000支,总人数突破4600人,报名截止时间为7月15日12:00。

怜星夜思:

1、量化比赛里,到底该优先追求复杂模型,还是先把验证体系做扎实?
2、在股票排序任务中,直接预测收益率和预测横截面排名,哪个更适合比赛场景?
3、特征工程里,为什么有时候特征越多,模型表现反而越差?
4、纯量价数据做股票预测的天花板在哪里?是否有必要引入新闻、政策、资金流等外部数据?

原文内容

图片











2026中国高校计算机大赛-大数据挑战赛线上赛A阶段第三次月月星奖项评选环节开始啦,经过组委会对参赛队伍提交模型和代码进行审核和复现荣获月月星的团队名单已出炉,恭喜获奖(每队发放奖金800元)的学生队伍!


目前榜单成绩最好的两支队伍在参赛中有哪些实战的经验呢?让我们一起围观他们的分享吧!

无糖可乐队伍

参赛经验分享



很荣幸能获得这本次经验分享的机会,我们团队此前有过数学建模竞赛经验,因此在参加本次大数据挑战赛时,第一反应不是马上堆模型,而是先把赛题拆成“数据构造、验证体系、排序模型、组合后处理”四个部分。赛题要求从沪深300成分股中选择不超过5只股票并分配权重,本质上不是简单预测某只股票涨跌,而是一个横截面排序与投资组合优化问题。


1.数据层面


我们整理了2015-01-05至2026-03-13的沪深300历史行情数据,共605859行,覆盖300只股票、2718个交易日。其中训练集604359行,测试集1500行。我们记录了Tencent、Baostock、AKShare等数据来源,并通过审计脚本检查股票池、日期范围和提交格式,避免数据泄漏和股票池漂移。


2.模型方面


我们的核心是`StockTransformer`。它的输入形状为:图片

图片 


这套结构先用TransformerEncoder学习单只股票过去60个交易日的时序特征,再通过CrossStockAttention建模同一天不同股票之间的相对强弱,最后输出每只股票的排序分数。相比直接预测收益率,我们更重视Top5排序质量,因为最终成绩由组合收益决定。


3.特征工程


我们构建了158+39维特征体系,包括Alpha因子、技术指标、残差动量、EWMA风险、横截面排名等。训练阶段使用WeightedRankingLoss,同时结合listwise、pairwise和Top-k加权思想,让模型更关注最终可能进入组合的股票。


4.验证


我们借鉴数学建模中的稳健性思路,没有只看一次划分结果,而是做滚动窗口验证。当前模型质量报告中,我们的Top5收益分别为0.03739、0.04065、0.03173;表现较好的recent_stable_val202602模型Top5收益达到0.05808,selection_score达到0.18685。


5.总结

我们没有依赖单一模型提交,而是融合Transformer、LightGBM LambdaRank、规则因子和协方差组合优化。ensemble_predict.py中实现了hybrid_guard策略,用树模型候选池和Transformer高置信候选共同筛选,再控制单票权重和组合风险。整个流程通过competition_workflow.py audit自动检查result.csv格式、权重和、滚动验证与数据来源。


这次比赛最大的收获是:金融任务中,模型复杂度不等于最终收益。真正重要的是目标函数贴近赛题、验证体系可信、后处理稳健,以及每一步都能复现。








绫袅的团队
获奖经验分享


一、理解与数据


采用 LightGBM 预测个股未来一周收益率。初期从量价数据构造 97 个特征(收益率统计量、波动率、换手率、横截面百分位排名等),验证表现不升反降;扩充至 142 个后过拟合更严重。我们认识到:信号密度比数量更重要,LightGBM 对有效信息密度高度敏感。


后续经信息系数分析和消融实验,剔除 IC 长期不稳定或符号不一致的变量,并去除相关系数 >0.9 的冗余特征,最终精简至 20 个,集中于波动率、成交量、价格位置的截面排名,模型表现显著提升。


二、训练验证


前期我们使用NDCG作为验证指标,但发现其与最终评分相关性不强。于是直接改用 “Top‑5等权持有一周的平均收益” 作为模型选择的核心指标——试验过不同加权方式,收益提升有限,等权最为稳定。


严格按时序切分训练/验证集,留出 5 天空窗期避免标签泄漏。采用 LightGBM 回归,做 50 次滚动验证(每次向前滚动一周)。约 68% 的验证窗口收益为正,最长连续亏损 3 个窗口,但周收益率波动幅度达 10 个百分点,预测仍具偶然性。


三、调参与超参数


超参数通过两阶段搜索确定:1. 单参数扫描(学习率、num_leaves、lambda_l1、lambda_l2、feature_fraction),各参数取前3个较优值。2. 对候选值进行网格组合搜索,以验证集最终收益率为选择依据。


四、反思


模型预测的平均收益水平不高,且最好与最差周收益差距超过10个百分点。资金流向、政策事件等外部因素是纯量价模型难以捕捉的;尝试引入 Alpha158 因子库扩充特征后,过拟合反而加剧。


当前模型的主要不足:纯量价特征、等权权重、单模型、固定训练窗口。此外损失函数、样本权重等方面仍有优化空间。我们也尝试过神经网络及其他时序模型,但受限于样本量,难以平衡过拟合问题。


五、下一步


我们最近将回归目标转换为回归排序问题——预测个股未来一周收益在截面上的百分位等级,并将验证指标调整为所选5只股票的平均百分位排名。在50次滚动验证上,平均周收益远超此前均值,正收益窗口比例显著提升,最优窗口收益可达 10%+,且仍有较大优化空间。




大赛报名人数持续攀升!目前,已有来自高校和企事业单位的3000多支队伍参赛,报名总人数突破4600人。参赛选手可以下载数据在本地进行算法设计和调试,并通过竞赛平台提交结果文件及模型代码,报名截止至7月15日12:00。


每一次努力都值得被看见,每一份才华都值得被赞赏。让我们一起,用代码书写梦想,用数据描绘未来!


扫码观看大赛启动会回放



大赛官方渠道主要包括:

大赛官网:https://nercbds.tsinghua.edu.cn/bdc.html

大赛邮箱:data@tsinghua.edu.cn

大赛QQ群:112186245 / 759142692/762146461

欢迎点击原文,了解更多大赛详情



往期回顾



关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。





新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU



针对“预测收益率还是横截面排名”,我更倾向排名。因为最终只选Top5,模型没必要把每只股票未来收益率都估得很准,只要能把相对更好的几只排到前面就够了。收益率回归对噪声太敏感,尤其是一周这种短周期。

1 个赞

回答“特征越多为何越差”:金融数据的信噪比本来就低,很多特征只是把同一类信息换个姿势重复一遍。模型看到太多弱相关、强共线、阶段性有效的变量,很容易学到历史噪声。文章里从142个特征砍到20个,反而提升,就是典型例子。

2 个赞