2026大数据挑战赛“月月星”首批获奖名单公布:两支领先队伍分享股票预测赛实战思路

大数据挑战赛月月星获奖队伍公布,两支领先团队分享股票预测建模经验。

原文标题:快讯|2026大数据挑战赛月月星评选获奖队伍公布,附赛事经验分享!

原文作者:数据派THU

冷月清谈:

2026中国高校计算机大赛-大数据挑战赛线上赛A阶段首次“月月星”评选结果公布,获奖队伍将获得每队800元奖金。文章重点整理了当前榜单表现较好的两支队伍的参赛经验。第一支队伍强调传统机器学习模型融合,围绕时序特征、横截面特征、市场环境特征构建输入,并使用LightGBM、HistGradientBoosting、随机森林等模型建立基线,再通过OOF结果进行二层融合;验证上采用时间序列交叉验证并设置间隔,避免数据泄露。第二支队伍更强调数据理解、清洗、验证集划分和特征稳定性,认为股票类赛题中鲁棒性比复杂模型更重要,过度拟合某一阶段行情容易导致线上回撤。文章还提到赛事报名已过半,已有1500支队伍、2300余人参赛,报名截止时间为7月15日12:00。

怜星夜思:

1、股票预测类比赛里,传统机器学习模型真的比深度学习更稳吗?
2、时间序列比赛为什么不能随机划分训练集和验证集?会差很多吗?
3、在这种选股排序任务里,特征工程和模型调参哪个更重要?
4、比赛方案里提到“空仓”和“风险惩罚”,这在算法比赛中算不算取巧?

原文内容

图片



2026中国高校计算机大赛-大数据挑战赛线上赛A阶段第一次月月星奖项评选环节开始啦,经过组委会对参赛队伍提交模型和代码进行审核和复现荣获月月星的团队名单已出炉,恭喜获奖(每队发放奖金800元)的学生队伍!


目前榜单成绩最好的两支队伍在参赛中有哪些实战的经验呢?让我们一起围观他们的分享吧!


康神开播了?真的假的
获奖经验分享

大家好,很高兴能和大家分享这次比赛的一些经验。我们的方案基于多个传统模型融合,单模型表现也还可以。下面从特征工程、模型、训练验证和组合策略四个方面介绍一下主要做法。


1. 特征工程


基础时序特征包括均线、收益率、波动率,窗口覆盖3、5、10、20、40天,从短期到中期都有尝试。横截面特征贡献比较明显,加入了个股当日涨跌幅排名、相对市场均值的超额收益等,用来刻画个股在横截面上的相对位置,与选股排序任务匹配度较高。还加入了市场情绪、涨跌比、整体波动率等环境特征,让模型感知当前市场背景。外部数据没有做扩展,直接使用比赛提供的训练集和测试集,保持流程稳定且易于复现。


2. 模型


先用了LightGBM、HistGradientBoosting、随机森林建立基线,表现都比较稳健。LightGBM Ranker与排序任务目标一致,实际使用感受较好。模型融合是核心环节:训练多个基模型,用OOF预测结果作为输入训练第二层融合模型,以降低单模型波动。此外训练了两个辅助方向,分别预测当日Top1和短期爆发型标的,为最终选股提供额外参考。收益预测和涨跌概率分开建模,未强制使用同一模型。


3. 训练与验证


时序数据划分验证集时不能随机打乱,采用时间序列交叉验证,共4折,折间留5天间隔防止数据泄露。每折验证集设20天,训练集至少120天,参数可根据实际情况调整。随机种子固定为20260416,便于实验复现和对比。超参数未做大规模搜索,基本沿用默认值,主要调整了树的数量,精力更多放在特征和标签设计上。


4. 组合策略


选股采用多阶段筛选:先生成候选池,再精排,最后加入风险惩罚。设计了target_precision_gate标签,要求收益为正、当日排名前25%、短期和中期表现稳定、最大回撤不超过3%,目的是提高命中率。仓位未强制满仓,市场状态不好时减少入选数量或空仓,保留现金。参数方面,LightGBM约200至300棵树,HistGradientBoosting约300轮,整体思路是先保证特征和验证可靠,再做参数微调。


以上是我们在比赛中的一些做法和思路,供大家参考,也欢迎一起交流探讨。







milky-frog
获奖经验分享


很荣幸获得第一阶段的月月星奖项,在此分享一些参赛过程中的心得体会,希望对大家有所帮助。


数据理解与处理


拿到赛题后,我们首先花了较多时间理解数据本身的特性。股票数据具有较强的时序性和截面特征,不同时间段的市场状态差异很大。我们在数据清洗阶段重点关注了缺失值处理和异常值识别,确保输入数据的质量。此外,我们发现合理划分训练集和验证集对于评估模型的泛化能力至关重要——简单的随机划分在时序问题上往往会高估模型表现,因此我们采用了时间序列相关的验证方案来更真实地反映线上效果。


特征工程


特征工程方面,我们的思路是从多个维度刻画股票的状态。除了基础的价量特征外,我们尝试了不同时间窗口的衍生指标,并关注了截面维度上股票之间的相对关系。我们认为,好的特征应该具备一定的稳定性和可解释性,过于复杂的特征组合虽然在训练集上表现好,但往往在线上会出现较大的偏差。因此我们在特征筛选上比较保守,优先选择逻辑清晰、在不同时间段表现一致的特征。


模型与策略


在模型选择上,我们没有一味追求复杂的深度学习架构,而是根据赛题特点选择了适合的方案。我们发现,对于本赛题而言,模型的鲁棒性比极致的拟合能力更重要。一个在多数情况下表现稳定的策略,长期来看往往优于一个偶尔表现极好但波动很大的策略。我们在迭代过程中也踩过一些坑,比如过度优化某个特定时间段的表现,导致在其他时段出现明显回撤。


最后,感谢主办方提供的平台和数据,也祝所有参赛队伍在后续比赛中取得好成绩!




目前,大赛报名阶段已过半,已有来自高校和企事业单位的1500支队伍参赛,报名总人数突破2300人。参赛选手可以下载数据在本地进行算法设计和调试,并通过竞赛平台提交结果文件及模型代码,报名截止至7月15日12:00


每一次努力都值得被看见,每一份才华都值得被赞赏。让我们一起,用代码书写梦想,用数据描绘未来!


扫码观看大赛启动会回放



大赛官方渠道主要包括:

大赛官网:https://nercbds.tsinghua.edu.cn/bdc.html

大赛邮箱:data@tsinghua.edu.cn

大赛QQ群:112186245 / 759142692/762146461



欢迎点击原文,了解更多大赛详情




关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU



回答这个问题可以从泛化角度看。随机划分默认样本独立同分布,但时间序列数据往往不满足这个假设。牛市、震荡市、下跌市的数据分布完全不同,如果验证集和训练集混在一起,模型评估会系统性偏乐观。

1 个赞

从比赛角度看,要看评价指标。如果指标只奖励命中某类标的,空仓可能未必有意义;但如果最终收益、回撤或稳定性会影响表现,控制仓位就是合理优化。策略和模型本来就是一体的。

3 个赞

会差很多,尤其是金融赛题。随机划分等于考试前偷偷看了后几页答案,虽然不是直接抄标签,但市场状态、波动区间、个股分布这些信息都泄露了。时间序列验证至少能更接近真实交易场景:只能用过去预测未来。

3 个赞

“传统机器学习更稳吗?”我的理解是:它更像一辆手动挡老车,跑不出科幻感,但不容易半路趴窝。深度学习像跑车,路况好能飞,路况烂也可能直接冲沟里。股票数据嘛,路况通常都挺烂的。

2 个赞

回答“空仓和风险惩罚算不算取巧”:我觉得不算。只要规则允许,这其实是策略设计的一部分。真实投资里不可能每天都强行满仓,市场状态差时降低暴露,本来就是风险管理。

3 个赞