【深度学习革命 - 从历史到未来 Genius Makers: The Mavericks Who Brought AI to Google, Facebook, and the World】这本书里详述了为何西方人工智能界(AI)对于 AI 如此戒慎恐惧,深忧它被少数白人(绝大多数为男性)统治,从而造成种族与性别的歧视(非白种人与女性更不容易被识别)、被锲而不舍试图染指 AI 的美国军方用于杀戮、被深伪技术 (Deep Fake) 利用来扭曲造假,影响民主及选举甚或用于犯罪...
著名的林纳斯定律 (Linus' Law):“足够多的眼睛,就可让所有问题浮现 (given enough eyeballs, all bugs are shallow)”。
但是当人脑的胶质细胞与神经元只有 850 亿个,而深度学习时代 的 ChatGPT 大模型的参数量达到了 1,750 亿,谷歌最近发布的 PaLM2 的参数更高达 5,620 亿。人脑与电脑越来越大的算法与算力差距,真的是更多的人眼就能看得出问题所在吗?
更核心的问题是,我们人类真的知道或是有能力分辨 “问题” 到底是什么吗?我们问出了对的问题吗?例如说自由与责任、群体和个人、正义与邪恶、政府与企业等的边界在哪里?谁来划分界定呢?
开源肯定是解决大公司垄断的选项之一,但是开源只是人类面向人工智能征程的开始。我们开源人任重道远!
--- 刘天栋 Ted,开源社正式成员
【导读】为了科学界的未来,加入开源LLM阵营吧!
免费的ChatGPT用的是很爽,但这种闭源的语言模型最大的缺点就是不开源,外界根本无法了解背后的训练数据以及是否会泄露用户隐私等问题,也引发了后续工业界、学术界联合开源了LLaMA等一系列羊驼模型。
最近Nature世界观栏目刊登了一篇文章,纽约大学政治与数据科学教授Arthur Spirling呼吁大家更多地使用开源模型,实验结果可复现,也符合学术伦理。
重点是,万一哪天OpenAI不爽了,关闭了语言模型接口,或是靠封闭垄断涨价的话,那用户只能无奈地说一句,「终究是学术败给了资本」。
文章作者Arthur Spirling将于今年7月加入普林斯顿大学教授政治学,主要研究方向是政治方法论和立法行为,具体为文本数据(text-as-data)、自然语言处理、贝叶斯统计、机器学习、项目反应理论和广义线性模型在政治科学中的应用。
研究人员应该避免商用模型的诱惑,共同开发透明的大型语言模型,以确保可重复性。
拥抱开源,拒绝垄断
似乎每天都有一个全新的大型语言模型(LLM)推出,其创建者和学术界相关人士每次都会对新模型如何与人类进行流畅交流的能力慷慨陈词,比如可以帮用户改代码,写推荐信,给文章写摘要等等。
作为一名正在使用并教授如何使用这些模型的政治和数据科学家,我认为学者们应该保持警惕,因为目前最受大众追捧的语言模型仍然是私有且封闭的,即由公司运营,他们不会披露基本模型的具体信息,只会独立地检查或验证模型的能力,所以研究人员和公众并不知道模型的训练使用了哪些文件。
急于将语言模型纳入自己的研究流程可能会出问题,可能会威胁到来之不易的「研究伦理」和「结果复现性」方面的相关进展。
不光不能依赖商用模型,研究人员还要通力合作开发透明且不依赖于某个具体公司利益的开源大型语言模型。
虽然商用模型非常方便,可以开箱即用,但投资开源语言模型是历史的趋势,既要想办法推进开发,也要让模型应用于未来的研究中。
我乐观地估计,语言模型工具的未来一定是开源的,类似于开源统计软件的发展历史,刚开始商用的统计软件很流行,但目前基本所有社区都在使用R或Python等开源平台。
举个例子,去年7月发布的开源语言模型BLOOM,其开发团队Hugging Face是一家总部位于纽约的人工智能公司,携手一千多名志愿者和研究人员共同打造,部分研发资金由法国政府提供;其他团队也在努力开源大型语言模型。
我认为类似这样的开源项目都是伟大的,但我们还需要更多的合作,需要汇集国际资源和专业知识。
开源大型语言模型的团队通常不像大公司那样资金充足,并且开发团队还需要持续运营以跟踪领域内的最新进展:AI领域的发展实在是太快了,甚至大部分语言模型在推出几周或几个月以后就会过时。
所以参与到开源中的学者越多,最终开源模型的效果也会更好。
留言🤔️:你怎么看?
参考资料:
https://www.nature.com/articles/d41586-023-01295-4
转载自丨Datawhale
编辑丨王梦玉
相关阅读 | Related Reading
开源项目Apache StreamPark遭遇侵权,相似度80%
OpenHarmony开发者大会正式召开 百业齐鸣开源共兴
开源社简介
开源社成立于 2014 年,是由志愿贡献于开源事业的个人成员,依 “贡献、共识、共治” 原则所组成,始终维持厂商中立、公益、非营利的特点,是最早以 “开源治理、国际接轨、社区发展、项目孵化” 为使命的开源社区联合体。开源社积极与支持开源的社区、企业以及政府相关单位紧密合作,以 “立足中国、贡献全球” 为愿景,旨在共创健康可持续发展的开源生态,推动中国开源社区成为全球开源体系的积极参与及贡献者。
2017 年,开源社转型为完全由个人成员组成,参照 ASF 等国际顶级开源基金会的治理模式运作。近九年来,链接了数万名开源人,集聚了上千名社区成员及志愿者、海内外数百位讲师,合作了数百家赞助、媒体、社区伙伴。