旗县动态

如何“手搓”一个审计专用AI大模型——让审计人员也能看懂AI大模型(一)

来源:内蒙古自治区审计厅

  最近这两年,每天早上打开手机都会被各种AI新闻“刷屏”。从ChatGPT一鸣惊人,到DeepSeek横空出世,从各种AI“Agent(智能体)”开发工具,再到手机APP里扎堆养电子龙虾……只见各大厂商火力全开,AI界一天一个“核爆”新闻,作为一名在台下看热闹的审计人员,除了感慨“活久见”之外,更多时候大概是这样的:一边激情转发见证历史,一边看着满屏的“参数”“Token”“Transformer”陷入沉思——字都认识,但他们到底在说啥呀?

  所以今天,让我们扔掉复杂的公式或架构图,请你坐下来,用几杯茶的工夫,我用尽量通俗的大白话,在咱们审计人的头脑里,一起搭起一个认识AI大模型的“脚手架”。我们先聊聊它工作时是怎么“想”问题的,再纵向往深里挖一挖,看看它是怎么从“小菜鸟”被训练成“大专家”的。这样看完之后,你不仅能知道那些“黑话”是什么意思,还能搞清楚我们审计人天天幻想的那件事——到底能不能“手搓”一个审计专用的大模型?我们使用AI时,它到底只是一个会搬运的“复读机”,还是真的融入了我们的“审计灵魂”?

  好了,闲言少叙,咱们这就开始。

  第一部分

  认识“你的AI同事”— 基础概念大起底

  首先,咱们得认识一下这位“神秘同事”的本质。你手机上装的豆包、DeepSeek,还有那些网页版的AI助手,它们的大名都叫“大语言模型”,简称LLM(Large Language Model)。你可以把它简单理解为一颗装着全人类知识的大脑。你跟它说话,就是在跟这颗大脑互动。

  它如何听懂你的话?

  Token与“续写”的本质

  你输入给它的那串文字,在AI看来是什么呢?这个过程很像一个“翻译官”在处理你的话。你的话就是Prompt(提示词),它会被AI里一个叫“分词器”的模块,切成一个个更小的颗粒,这些颗粒就叫Token(词元)。

  怎么切呢?有点像吃甘蔗,要一节一节地啃。比如你输入“我在学审计”,它可能切成“我”、“在”、“学”、“审计”这四个Token。大模型有它自己的“字典”,它会结合语境判断是把“审计”两个字合起来当作一个Token,还是拆分成两个单独的Token。在这个“字典”里,每个Token其实都对应着一个独一无二的数字编号,你可以理解为这个Token的“身份证号”。

  当AI把你说的话转化为Token的“身份证号”连成一串后,AI要做什么呢?它的任务其实只有一个,也是最核心的——算出在你输入的这一串Token序列后面,应该“续写”哪些Token。

  为了完成这个“续写”任务,现在的大模型普遍采用了一种叫“Transformer”的“魔法架构”。我们不需要知道它的具体结构,只要记住它的“超能力”是:能像一个超级灵敏的“关系网分析专家”,快速捕捉到一句话里各个词之间的关联度。比如,在“审计人员完成了现场审计”这句话里,它能准确识别出“审计人员”和“现场审计”关系最近,两者指向同一个主题。

  当它开始“续写”时,过程特别像是在玩文字接龙。它会先根据你给的Prompt,算出第一个最应该出现的Token,然后把这个新Token加回到原序列里,重新计算;再算出下一个Token,再加回去……这样一次只算一个,周而复始。所以,不管你问什么问题,AI的本质工作其实就是在一遍遍地“写剧本接龙”,直到拼出一篇完整的回答。

  为什么它要联网搜索?

  —— 揭秘RAG 

  你现在用AI的时候,可能会经常点一个“联网搜索”按钮,或者觉得不过瘾,还可以给它外挂一个自己的知识库(比如上传一堆法律法规让它学习)。这个操作背后,其实是一个叫“RAG”(Retrieval-Augmented Generation,检索增强生成)的功能。

  它的思路很简单:与其让AI靠自己那“半桶水”的记忆瞎编,不如让它先去查查资料,再把查到的资料“喂”给它,然后再让它来“接龙”写答案。

  你可以想象,你让AI写一份审计报告中可能会引用关于“新会计法”的内容。如果它没有最新的数据,它可能会引用旧版的内容从而写错。但如果你使用了RAG,它会先偷偷去网上或者你上传的文档里,把“新会计法”的相关条款“搜索”出来,然后把这些内容加到它“接龙”的起点里(即跟你的问题拼接起来),最后才启动“续写”魔法。所以,RAG就像给AI请了一位随身的“资料库秘书”,让它不会“一本通书念到老”,大大提高了输出的准确性和时效性。

  它到底有多“大”?

  从“大力士”到“专家团”

  我们总说大模型“大”,那它到底大在哪?这就得讲到一个核心的概念——参数。

  大模型内部,有无数个可以调整的“小旋钮”,我们把这些旋钮的个数称为“参数数量”。你可以粗暴地理解为,参数越多,模型的“脑细胞”越多,理论上也就越“聪明”。这就是现在流行的理念:“大力出奇迹”。你看,很多模型的名字后面都带着一个数字:GPT-3刚出来的时候是1750亿(175B)个参数;满血版的DeepSeek R1已经到了6710亿(671B);而最新的Kimi K3的参数已经拥有2.8万亿参数。

  你可以想象一下,你只是跟它说了句“你好”,它就要调动上千亿个“脑细胞”来给你“内心戏”一番,这未免也太隆重了。所以网上才有段子说,我们对AI不要太客气,因为每一次说“请”“谢谢”,背后都是数以亿计的算力在为你“表演”。

  像这种每次说话都要调动所有参数参与计算的模型就是“稠密模型”,像是一个热情过头的“大力士”,无论问题大小,它都会把所有力气都用上,动用全部“脑细胞”,爱得轰轰烈烈,但也很耗电(算力)。

  而像DeepSeek这种模型,其实更“聪明”一点,它属于“稀疏模型”,这类模型采用了一种叫“MoE”(混合专家模型)的“冷静专家团”策略。怎么理解呢?MoE模型内部,有很多个“专家网络”,比如有“金融专家”“工程专家”“语言专家”等等。当你问它“这个部门的资金预算执行情况如何”时,会有一个叫“门控网络”的“调度员”,判断这个问题该交给“金融专家”和“预算专家”去处理。它只会激活与问题相关的几位“专家”,其他的参数就保持待机状态。这样既省电(算力),又高效,还能针对性地解决问题。

  总结

  好了,到这里,我们基本搭起了AI大模型工作的“横轴”,就是它“接收你的问题(输入)→ 分词(Token)→ 调用参数(专家网络)→ 给你续写答案(输出)”的基础流程。现在你知道了什么是Token、Transformer、参数、稠密vs稀疏模型,还知道了它为什么需要联网搜索。

  但是,这里有一个核心问题还没解决:那数千亿个“小旋钮”(参数),到底是谁来拧?怎么拧,才能让这颗“大脑”变得这么能说会道、这么聪明呢?这就要等咱们第二部分要讲的“纵轴”——大模型的“学习成才之路”。

上一篇:

下一篇: