胡澎 发自 凹非寺
量子位 报道 | 公众号 QbitAI
世界杯小组赛将收官,你还依然信AI吗?
冷门频出,黑马击败豪强。不少AI模型始料未及。
到底还能不能愉快找到科学规律?或者说足球比赛乃至其他竞技体育赛事,数据科学家在AI加持下,究竟能做到多大程度的预测?
瓶颈在核心数据匮乏
如果让谢波回答这个问题,他会告诉你:“单利用神经网络模型对世界杯的胜负、比分进行预测,存在一定难度。”
谢波是北京猜猜科技CEO,他认为世界杯预测难,最根本的原因是核心数据的匮乏:比如国家队之间的历史交战记录非常稀疏,无法提供足够多的信号支持预测的结果。
以本届世界杯开幕战俄罗斯对阵沙特阿拉伯的比赛为例,两队上次交手是在1993年的一场友谊赛,距今已经25年。神经网络模型很难在这样的数据基础上发挥它的威力。
但球赛预测也不是完全毫无办法,在动手实践后,谢波团队发现,如果把包括五大联赛在内的职业联赛当做预测样本,效果将大大不同。
五大联赛指的是欧洲五大职业足球联赛,分别包括英超、西甲、德甲、法甲和意甲联赛。这些联赛有比较完整的商业化体系,也有比较领先的数据采集和数据流转的商业化机制。
所以第一步,获取数据。
相对挑战的是,体育行业的数据相对金融等其他领域,具有来源众多、标准各异、置信度参差不齐等特点,导致很难从某个权威的数据公司获取到一份全面、准确并且标准化的数据。
举个例子,描述一场比赛的赔率数据和基本面数据存在于不同的来源。不同来源的数据需要通过一个非常严密数据流程进行关联和加工,仅仅队名这个最简单的字段在不同来源的叫法都不一样,任何一个小的数据偏差或者丢失都会导致最终神经网络预测结果偏差,影响准确率。这里面的技术活非常的具有挑战性。
此外,还要考虑足球比赛的实时性。所以在已经积累了欧洲主流联赛近10年的数万场比赛历史数据后,猜猜科技的模型还加入了百万量级的赛中实时数据。
然后进入第二步,预测回报率导向。
体育竞猜领域有几个常见的误区。比如,比赛的赔率是博彩公司通过对于比赛本身的判断以及大众投注的选择等因素,综合考虑后给出的比赛投注回报。
例如博彩公司开出主队赢2.25的赔率,其意义就是投注者如果投主队获胜,且比赛结果真是主队获胜,则投注者可以获得其投注额的2.25倍的回报。
而对比赛结果进行一定的判断,给出一定的概率估算,这里预测的是概率。
在此基础上,更为重要的一个概念是价值回报率,该指标则是综合考虑了赔率和结果概率,对于每场比赛的胜负平等结果,都是其对应赔率和预测概率的乘积。
价值回报率可以认为是赔率的可套利空间,或者说是赔率的期望回报值。
于是从预测回报率的角度出发,公式如下:
Returns = Max { Σ Odds | Pro, Val, α } ,其中Odds为预测结果的赔率,Pro为预测的概率,Val为预测的价值回报率,α为选择的策略。
紧接着,就可以看看这个专为预测而打造的模型了,分为两部分:
基于深度学习技术的比赛预测模型,以及基于价值回报率的投注策略模型。
一个个看。
基于深度学习的比赛结果预测模型
深度学习技术作为传统神经网络算法的延伸和扩展,当前在图像识别、语音识别、自然语言处理等领域获得了巨大的成功。
将深度学习技术引入到足球比赛的结果预测中,可以综合利用历史的比赛记录,以及各种实时的数据信息,进行训练和计算。经过数万场比赛的洗礼,庞大数据量的分析,以学习掌握决定胜负的关键因素。
无论是赛前球员的伤病,还是教练的奇招,众多的线索都可以从海量的数据中能获得“蛛丝马迹”,帮助模型得到准确的预测结果。
△ 图:基于深度神经网络的比赛预测
当前猜猜科技的深度学习模型通过对过去两万多场比赛的训练,利用百余维特征,包括球队的基本面(射门数、抢断数、助攻数、控球率等等),几十个渠道(欧赔、亚赔等)的赔率信息,以及历史上的战绩。
经过神经网络的编码和序列解码,以及有效的注意力机制的引入,可以对比赛结果进行准确的预测(包括结果和比分)。
进一步,团队后续还利用多组子模型进行多层次的结果融合,获得最大的性能收益。当前最优的模型可以稳定的达到68%的预测准确性。已经超过了人类专家的顶级水平。
引入价值回报率的最优投资组合的搜索
在已知结果概率和赔率的情况下,选择哪些比赛进行投注,投注的比例又是如何,这是投注策略所关注的问题。
不同的预测概率,会有不同的价值回报值,根据不同的价值回报率,我们会采取不同的下注策略,这就涉及到一个最优投资组合的搜索问题。
搜索的空间是根据赔率,预测的概率,价值回报率以及不同的预测模型等组合而成,如何在百万计的投资组合中进行最优搜索,成为核心问题。
△ 图:基于遗传算法的参数组合搜索
猜猜科技利用剪枝优化的策略,结合遗传算法等多种搜索策略,对最优参数空间进行检索。
遗传算法等并不基于梯度进行计算,算法本身能扩展到巨大的参数空间。重点设计并优化算法的初始条件、选择运算、交叉运算以及变异运算的关键步骤,并且将启发式的裁剪策略运用在遗传算子中,最大限度优化搜索的空间和时间消耗,最终获得最高投资回报比的投资组合参数。
为了测试这套模型, 猜猜科技对 2012 年到 2018 年期间 2 万场足球比赛进行了模拟训练,在测试集300场比赛进行测试,回报率为41%。
在足球领域,这个回报率已非常不俗。
背后团队
最后,介绍下该模型的核心打造团队——猜猜科技,CEO谢波和CTO郭杨,和包括首席科学家在内的神经网络团队,均来自“西二旗”,是前百度核心业务部门的技术和产品骨干。
CTO郭杨透露,打造该预测模型,只是因时制宜的牛刀小试,希望打造一个类似AlphaGo的围棋培训和教学工具,最终目的是能够帮助国内的彩民群体提升他们的赛事分析能力和投注技巧。
但只是一个机器辅助决策类的应用,后续更广泛的场景,是希望将能力应用到更多有意思的领域,比如电子竞技、创造101选秀竞猜、加密货币价格走势中……
— 完 —
加入社群
量子位AI社群18群开始招募啦,欢迎对AI感兴趣的同学,加小助手微信qbitbot8入群;
此外,量子位专业细分群(自动驾驶、CV、NLP、机器学习等)正在招募,面向正在从事相关领域的工程师及研究人员。
进群请加小助手微信号qbitbot8,并务必备注相应群的关键词~通过审核后我们将邀请进群。(专业群审核较严,敬请谅解)
诚挚招聘
量子位正在招募编辑/记者,工作地点在北京中关村。期待有才气、有热情的同学加入我们!相关细节,请在量子位公众号(QbitAI)对话界面,回复“招聘”两个字。
量子位 QbitAI · 头条号签约作者
վ'ᴗ' ի 追踪AI技术和产品新动态