00:01
哈喽,大家好,我是任月刘艾,今天我准备系统性的跟大家分享一下我最近两到三个月做的一个重要的事情,就是怎么样去搭建AI的个人智能知识库,包括借助AI工具去进行辅助写作。首先在这里我想强调一个关键点,就是我基于AI去辅助写作,其实并不是说希望AI帮我创新的去生成什么新内容,而是对我最近十多年时间积累的大量的博客的文章、文档,能够进行系统化的归纳总结,输出符合我问题和目标的这么一类的文章。所以说简单来讲,它不是说叫AI写作,而是AI辅助历史知识的一个归纳。我今天准备讲两个部分的内容,第一个方面就是我历史已有的知识素材应该怎么样去处理,第二个就是我尝试试用过的一些AI工具,大家也可以一起看一下它最终的一个效果究竟怎么样。
01:15
对于知识素材的处理,其实包括两个方面,第一个就是个人的文章转PDF,第二个就是PDF的文章内容,进一步把它转成一个个结构化的markdown文件加离线下载下来的图片。首先我们来看一下。大家都知道我在微信公众号也分享过相关的文章,就是我原来在公众号,在头条号写了200多300篇文章。我自己通过AI辅助编程工具,然后写了一个网页爬虫,然后把这些文章单独的成了一个个独立的PDF文件,这一些PDF文件本身它就是一个图文并茂的PDF文件。
02:05
图文并茂的PDF文件,所以说可以看到这样爬取出来的文件,它的整个结构和逻辑仍然是相当完整的,这里面既涉及到有SOA和云计算,也有个人知识管理的。我个人知识管理的文章,也有思维类的一些文章的总结。我个人思维类文章的总结,还有类似于核心的数字化转型方方面的一些文章,所以原来我也讲了,如果你需要这一些离线的PDF文章,大家可以关注人员聊it,我的微信公众号置顶就有一个这个离线文章的一个下载,但是这个下载本身它也是付费的,所以这个文章我拿到了以后,我接着做的很重要的一个事情,就是我可以把这些文章导到我的艾玛的知识库里面,所以我单独建了一个人月聊it的知识库,把我所有的文章导了进去,这个地方导了接近2000多篇,这个就不仅仅是我公众号头条的文章,也包括我从06年开始写新浪博客写的所有的一些文章。
03:13
当然我们也可以把它导到cher studio里面,Cherry studio本身也有一个文章导入的功能。这个就是我第一步。我去做知识本身的一个处理的时候,做的第一步的工作,将个人文档转成PDF。但是转成PDF以后,我们发现我特别是以后后续我再用类似于TR这一些辅助编程工具来写作的时候,我发现这一些PDF文档,你怎么样去让辅助编程工具去识别,去处理呢?那这个时候显然不方便,所以说我接着又做了一个重要的一个步骤,还是借助carzr编程写了一个程序,他将我所有的PDF的文章,把每篇PDF文章转成一个个独立的markdown的文件。
04:04
同时由于PDF文章里面有图片,它又把图片单独摘出来,存成一个个独立的图片文件,所以说做了这个处理以后,我们可以看到它就会形成一个。Markdown格式的内容,下面这一些就是我独立的一篇篇mark克down格式的文章,大家在里面也可以看得到,这个是markdown格式的文章的内容,马格down格式的文章的内容。同时,他还做了重要的一个事情,就是文章里面有图片,他将图片单独把它生成出来,放到了image目录下面。大家可以看到整个图片生成的效果还是相当不错的。所以这个图片其实对我日常写文章帮助也很大,类似于我要去写架构类的文章,我可能单独搜索架构,那出来的就是原来我画过的所有的架构设计的图,如果我是要去写思维方面的文章,我单独就搜思维,它出来的就是我原来画个人知识管理,画思维框架逻辑形成的一些核心的架构图。
05:11
这样的话,就形成了我原来非结构化的PDF文件。通过程序处理以后,它就变成了一个个独立的markdown文件和一个个独立的image文件,这样的话就方便我后面去做进一步的处理,这样我就完成了知识素材的处理,这个完成以后,接着就是我平时有问题,有目标,我要去进行问题回答,或者是知识写作的时候,我怎么样更好的去用AI的工具。在这一块,我们写了一个很简单的问题,这个问题就是你平时有哪一些让你受益的思维习惯?就这么一个问题,当然这个问题里面我让AI帮我辅助回答的时候,我仍然是做了很多的一些要求,类似于回答必须来源于我个人的知识库,回答你必须逻辑完整,通俗易懂,整个回答2000~3000个字中间你可以有小标题,每个小标题内容字数在400~800字。
06:12
而且回答要以第一人称进行,回答的文章风格应该跟我历史文章风格一致。而且在第5点,我还专门强调了你整个你要做的事情是对我历史知识库的内容进行重新归纳和整理,形成一篇条理清楚、逻辑性强的文章。这个可能就是我问AI的问题,那么拿着这个问题以后我们可以试一下,第一个就是我验证了挨骂的知识库。I玛的知识库,我把这个问题给他以后,我们用了DB c re的模型,基于这个模型,Ima知识库得出了一个输出。从这个整体的输出,我们注意,我们看到一个相当重要的问题,就是什么呢?艾玛的知识库仅仅是根据我的问题做了我知识库内容的一个rag的增强检索,然后对检索出来的内容简单去做一个归纳。
07:06
这个归纳其实我很难把它形成一篇完整的文章,而且整个归纳里面仍然会出现很多很虚幻的一些词,类似于如同精神骨骼般,我原来文章里面从来不会这出现这一些比较虚幻的词,包括什么个人智慧的生产线。这些包括什么时空维度加结构解剖,什么信息洪流?还有类似于左手解剖刀理清本质,右手握工具箱对症下药,这些都是AI幻觉杜撰创新的一些新名词,感觉很高大上,实际上这些内容根本不是我写的,所以说挨骂知识库输出的最终的文章的回答很难满足我的一个要求。所以接着我又去试了一个很重要的东西,就是Cherry studio. 为什么我试了Cherry studio呢?因为Cherry studio有一个很大的好处,你引入的模型以后,它可以在这个地方点设置以后,它可以在这个地方设置模型温度。
08:12
当我把模型温度设置到0.10.2的时候,可以看到整个的幻觉相对来说就会小很多。对于切入CD,我们仍然设了两个,第一个就是试了deep r1的模型,大家可以看到R1模型本身的输出内容相对来说好了很多。但是其实仍然没达到我的要求,包括每个小标题要400~800字,文字化详细的描述,他其实是没有做到的,包括里面仍然还会有小量的一些幻觉,所以对于RE1模型试完了以后,我们接着又试了deep的V3的模型,大家可以看到V3的模型的输出仍然。我感觉不是特别理想。而且我发现一个很奇怪的一个问题,就是特别是对于deep,不管是R1还是V3模型。
09:03
这个跟我在刚初他刚出来的时候,我用它的时候,质量整体的效果水平,我个人的感觉是明显下降,不知道大家是不是也有类似的一个感觉。这个就是我基于艾玛和studio做了智能知识库回答问题和写文章的一个初步的验证。而且这两种工具还有一个问题,就是他没办法写图文并茂的文章,他更多的是输出文字化的内容。所以我刚才做了重要的事情,我把它文章转成了markdown文件和一个个独立的截图以后,我们就进入到了carr工具里面。我们希望color工具来帮我做这个事情,写结构化的文章,所以对于color,我的提示词唯一出现的一个变化就是什么呢?我会告诉他新回答需要在新的目录下生成一个新的markc文件,而且需要图文并茂,而且我告诉他你可以引用我image目录下的所有图片,而且image图片它本身有文件的命名,你可以参考这个文件命名来发现你配的这个图是不是跟你的文字内容相匹配的。所以有了这些提示以后,我首先我们可以看得到我刚才。
10:23
生成的markdown的文件和图片,我单独建了一个car项目,我就把我的所有的markdown的文件,包括我的图片全部引入到了这个项目里面。然后我基于car的。去进行相关的问答。就是还是刚才这个问题这么一个回答,现在我用了GBT4.1的一个模型cloud4.0,没有暂时没有付费去使用好,即使我们看GBT4.1的一个模型,它仍然给出了我一个相当完整的一个输出,就是有哪些让我思受益的思维习惯,这个文档的输出我们可以看得到。
11:03
当我们把预览打开以后,可以看得到它就是一篇完完整整的图文并茂的文章,包括思维学习,怪决定成长路径,结构化思考,让复杂问题办变得清晰可见,深度复盘,从经验中提取可复用的规律,跨领域习学,打破思维的定式,拓展认知边界,包括这个地方配的知识结构的图也相当合理,然后目标驱动,进化并环,包括分类抽象,提升本质的洞察力,配了我思维框架的图也不错。所以说可以看得到,通过car工具,它可以很方便的在理解我的问题以后,帮我说出结构化的图文并茂的这么一种文章,而且这个文章它本身就是一个macdown格式的,类似于你在用微信公众号,在用支付的时候,它其实都是很容易支持你直接导入macdown格式的一个文章,这个是我验证cur的一个情况。
12:03
好了,对于color验证完了以后,我们最后再来讲一讲flow with这么一个工具。Flow位置这个工具一样的问题,一样的问题,我们去做了一个验证,好flow位置这个工具我们看一下,首先来看一下它的分析,大家可以看到在我上传了知识库,当然里面第一步仍然是要上传知识库。先把你的知识库建进去,建进去以后大家可以看到flow with对问题的分析,他会从我提出的问题的各个维度去进行分析,包括文档核心内容的确认,文档符合度的评估,内容来源的一个分析,逻辑型易懂性要求的一个分析,字数的要求的一个分析,小标题的一个分析,行文风格的一个分析。核心内容的一个分析、评估、总结和建议。
13:00
所以从这个地方大家可以看得到flow工具,它已经不是一个简单的rag的增强检索,它其实是一个很复杂的,能够去帮助你进行问题回答或写作的一个通用的垂直的智能体。这个智能体,他拿到问题以后,他会将问题拆解为多个子问题,针对每个子问题,他都会去做相关的任务规划和任务执行。然后每个任务返回的东西以后,他再总结,进行汇总。而不是像类似于IMR知识库一样,将你的问题一股脑的去到知识库里面去做增项检索。所以基于这种方式,我们看一下。Flow最终他会从内容来源、逻辑性、自述、小标题、风格、思维习惯多个方面详细的去做完梳理,梳理完以后最后得到一篇文章,这个是最终flow with说出的文章,大家可以看得到。
14:03
这个文章实际如果是我个人自己基于我的知识库去总结、去柔和它,基本上也是这个效果。因为Flowwe最后写出来的这个文章,90%的内容,或者是95%以上的内容,都是我原来历史知识库里面的内容,只是它基于我的问题,对这一些内容做了进一步的逻辑处理,让他整个的逻辑更加清晰,更加完整,包括类似于资料库、知识库、经验库、模式库的这些内容,其实都是我原来自己写的内容,你看它整体,你究竟应该养成什么样的思维习惯呢?他把总结成了关键的几个点,第一个就是持续构建迭代个人的知识经验库,第二个就是以实践驱动的系统化总结和写作,第三个结构化的分析和模式匹配,第4个,主动学习,持续改进自我。政务这个核心刚好就是我。
15:02
回答这个问题最最核心的一个内容。所以通过刚才的一个讲解,大家可以看得到,对于AI辅助写作这么一个事情。它其实不同于简单的智能知识库,AI的智能检索,如果你简单的智能检索,你可能用ima知识库,用Cherry studio就足够了,但是你如果已经有大量的文章素材,文档素材,你期望AI能够基于这一些素材帮你去构建重新的归纳总结一篇新的问题的答案,或者是完整的文章,那么其实我推荐的方式,一个就是基于科R,因为K它可以输出图文并茂的文章。第二个我个人推荐的方式就是类似于flow。或者是类似于蜜塔天宫这一些超级智能体,但是他必须要能够上传你的个人知识库。基于你的知识库,它能够做更加复杂的问题的理解,感知任务的拆解,最后输出符合你需求的这么一种文章。
16:10
好了,今天关于AI智能知识库和AI辅助写作的一个分享,就跟大家分享到这里,希望对大家有所启发。再见。
我来说两句