ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI大模型到底是什么?一文说清楚它是怎么工作的

AI大模型到底是什么?一文说清楚它是怎么工作的 直至今时今日, 我依旧不太能够去相信, 一台从事写代码工作的机器, 在未来的某一天, 极有可能真的会把程序员赖以生存的饭碗给彻底端掉。老实讲, 听闻“AI大模型”这几个字眼之时, 好多人的首个反应呈现出懵然的状态。诸如之类, 还有神经网络, 听闻起来仿若科幻影片或者网络小说里的事物。然而咱们今日就要细致剖析、阐释清楚, 将其以通俗易懂的语言说明表述出来。AI大模型到底是什么东西先别被那些专业术语吓住。简言之, 大模型乃是一个阅读了数量极为庞大的书籍、篇幅众多的文章的“学生”。它所阅读的书籍数量究竟有多少呢? 不妨这样讲, 寻常一个人终其一生能够阅读的书籍, 大致在几十万字至几百万字的范围。然而, 对于一个大模型来说, 在进行训练之时所读过的文字, 大约是几万亿个字符。你算算这个量级差了多少倍然而它与人存在区别之处在于, 并非是“理解”了这些文字, 它乃是记住了文字彼此间的规律, 举例来说, 当你书写“今天天气真__”时, 它极有可能会猜测“好”或者“不错” , 这是由于在之前它见识过太多诸如此类的搭配了。这就像你做了无数道填空题然后把答案都背下来了。在2022年以前, 最大的那些模型, 参数数量也就仅仅几百亿而已。而到了2024年的时候, 顶尖模型的参数量已然突破了一万亿大关。那参数究竟是什么呢? 你能够把它理解成为是模型大脑当中的“神经元连接”数量。参数的数量越多, 那么所能记住的规律也就会越复杂。它靠什么学习知识这里得提一个词叫预训练。经过预训练的过程, 实际上是较为简易的状况, 也就是持续地致使模型去预测接下来的那个字究竟是什么东西。此时, 为其提供一段文字内容, 促使它进行下一句含义的猜测行径。要是预测正确了, 便会给予分数增加的操作, 要是预测错误了, 那就对自身内部所具备的参数予以调整的行为。这个过程重复了几十亿次甚至更多。试想一下, 你安排一个小孩子, 每日去答好几万道有关阅读理解的题目, 那些题目当中包含了天文学, 包含了地理学, 又包含了历史学、编程学、医学以及其他种种学科, 并且让他持续去看这样的题目长达十几年之久, 你觉得他怎么可能不变得厉害呢?不过呢, 尽管那很厉害, 可它并非是真的“懂”实际上, 它仅仅是在模仿人类说话的那种方式方面比较擅长罢了。这便是为何有时你同它交流得极为投契, 它的回复既温柔又专业, 然而你或许会陡然察觉到, 它并无情感, 它仅仅是在效仿有情感的人类进行言语表达。这种感觉挺奇妙的说不上是惊喜还是恐怖。大模型能做什么现在大家用得最多的就是聊天和回答问题。你向它询问“怎么去创作一首情诗”, 它能够为你撰写出来一首看上去还颇有点模样的诗 , 你向它发问“怎么去修理电脑”, 它可以给你罗列出一长串的步骤。但它最让人惊艳的其实是写代码。2023年, 有一项研究表明, 在处理某些基础编程任务之际, 大模型之中的正确率已然达到了67%上下, 对于简单情形下的bug修复行为、代码补偿齐全状况而言, 它甚至呈现出来的结果并不比一个刚刚入门的程序员要差。这意味着什么意味着很多重复性的编程工作确实可能被替代。不仅是编程, 翻译、写作、总结以及数据分析, 它均能够胜任。你将一篇字数达几万字的报告交付给它, 它能够给你提炼出核心观点。你给予它一堆数据, 它能够帮你绘制出图表对趋势予以描述。但它不是万能的。它真的会思考吗这是很多人纠结的问题。按照严格的说法来讲大模型并不具备思索的能力。它所进行的行为称作“模式匹配”。当你给予它一段文字信息的时候, 它会在自身所拥有的知识库之中寻觅最为相似的模式情况, 随后据此生成一个整体看上去颇有合理性的回应答案。它不知道自己在说什么。比如说, 假设你对它讲“请证实勾股定理”, 它能够为你撰写出貌似极为严谨的证明流程, 然而它并非实际上明白勾股定理究竟是什么, 同时也不晓得证明所涵括的是什么含义。它只是在模仿证明数学定理这种文本的写作方式。有一些科学家, 把这样的一种现象称作“模拟智能”, 它呈现出看起来好似智能的样子, 然而其底层的逻辑却是全然不一样的。好似你于观看一场极为逼真的木偶剧, 你或许会心生感动, 或许会被其吸引, 然而你明知那些角色并无生命。2024年, 有研究人员发觉, 当模型的参数量超越某个临界点之际, 会出现一些“涌现能力”, 即模型忽然呈现出一些先前未曾有的能力, 如跨领域的推理能力, 这个临界点大概处于多少呢? 大概在100亿到1万亿参数之间。这究竟意味着什么呢? 意味着在你逐渐将模型加大至一定程度的时候, 它说不定就会“无师自通”某些能力。这样一种现象使得诸多研究者产生了既兴奋又困惑的情绪。大模型有哪些局限性说这么多好处也得说说它的毛病。第一个也是最被人诟病的——它会幻觉。何谓之幻觉乃其会正儿八经地胡言乱语。你向其询问 “爱因斯坦系何年所生”, 它或许会给出一个看似极为笃定的答复, 然而这一答复却全然纰缪。据统计, 于 2023 年的某些测试当中, 大模型在事实性问题方面的错误率大致处于 10%至 20%之间。该数字看起来不算高, 然而置于实际应用当中却相当可怕 --, 你采用了它 100 个答案, 或许会有 10 至 20 个是错误的。进而它自身并不知晓何为正确何为错误, 随即它会以十分自信的口吻述说出不正确的讯息。第二个问题是它没有真正的理解。这儿恰似你于网络找寻到一份菜谱, 依照其去烹制一款菜肴。菜肴之所呈现出美味, 是缘由于已依循步骤而行, 并非籍由你对烹饪的深谙。大模型亦是如此这般情况, 它可给出看起来颇为正确无误的内容, 然而它并不领会内容之中所蕴含的意义。第三个问题它的知识是有截止日期的。绝大部分的那一些模型, 其用于训练的数据, 仅仅是更新至某一特定的时间点而已。打个比方来说, 倘若你向它询问有关2025年所发生的某一件重大的事情, 它极有可能是全然不知晓的。要除外的情况是, 除非你为它投喂最新的资料信息, 又或者它自身本就是处于在线实时学习的版本状态。为什么有时候会胡说八道这个问题说到底是因为大模型本质上是一个概率机器。它对下一个字进行预测所凭借的是概率态势, 即哪一个字展现出的出现概率处于最高水平, 它就从中择取那一个。然而在特定的某些情形状况之下, 出现概率高居首位的答案实际上恰好是存在错失失误的那个。你去思考一下, 人之所以犯错的缘故是什么呢? 那是由于你头脑里的各个知识点之间, 极有可能存在着关联方面的错误情况。大模型的情形与之相同, 它所具备的知识点, 是依靠统计关联来构建形成的, 并非是凭借真正意义上的理解得以确立的。所以, 当它碰到并非训练数据里所具有的问题之时, 它会“牵强附会瞎凑”, 也就是, 运用既有的模式凑合出一个表面上看似合理的答案来。这就是幻觉产生的机制。存在一些团队, 它们投入精力致力于解决此问题像是向着模型增添“验证机制”, 促使其在输出答案以前先行展开自我检查。然而当下所取得的效果尚未达到较为理想的程度。大模型的未来会怎样这个不好说。有人讲它只会持续递增, 愈发强盛。还有人说它会碰到障碍, 缘于是单纯地堆砌参数已没那么高效了。目前来看两者都在发生。模型规模仍持续不断在扩大着, 2024年所发布的新一代模型, 其参数已然冲破了万亿级别, 另外一方面, 研究者也着手开始探索更为高效的学习方法, 像是运用更少的数据、更短的预训练时间来达成同样的成效句号。还有一个趋势越来越明显——大模型正在和具体应用结合。你不会再度去问“大模型能够做些什么”, 而是会去问“这个功能是借助大模型来做的吗”。它已然如同水电那般, 无声无息地流淌于各类工具以及软件之中。这件事情自身不存在什么好与坏之分, 然而, 我们以使用者的身份来讲, 务必要清楚它所能达到的能力限度究竟是处在何方, 这是非常关键的。借助它来对工作予以辅助, 这无疑是一件好事情, 然而, 要是将重要的决策全然交予它, 那么, 或许就得对此打上一个问号了。毕竟, 不管大模型有多厉害, 终究是人造出来的。它所映照的是人类知识的倒影, 并非原本的知识自身。你能看到它有多强也能看到它有多弱。
返回列表