00:01
嗨,哈喽,大家好,我是唐宋元,今天跟大家分享一个。我用乌克巴做的一个不错的一个产品啊,因为乌克巴蒂我觉得能力越来越强。他比这个K斯吧,我觉得,嗯,没有就网上吹的扣袋那么强啊,呃,我和巴国内的不太强,其实国内我觉得至少沃克巴蒂吧,我从2月底3月份儿开始用到现在,我觉得他们能力提升非踌快啊。而且我觉得目前。嗯,这类些产品。它的核心核心的差距,其实base model的影响并没有那么大,而是你A镇的产品的这块,其实我8它的生态是最好的,现在用户数应该也是最多的,因为他月活应该是有1000多万,呃,肯定是远远碾压这个K的啊,嗯,所以我我认为乌克巴蒂它的功能迭代呃,肯定会快于海外的这个产品,所以桌面通用A正的这个方向我还是很看好我和芭蕾的,呃,言归正传,我说一下我怎么。
01:07
做的这个产品啊,呃,首先它的需求是一个非常明确的啊,咱们各个行业。嗯,只要你做to b的,你都会需要想要一个全国的啊,某某行业的啊,招投标的一个总看法,这个其实我做了这么多年啊,不管之前在哪个公司,大家都有这种需求,呃然后呃一之前做这个需求需要你有一个爬虫啊,至少一两个爬虫人员来不停的做脚本,收集数据,还要反扒,呃收集好数据之后,他做这个ETL处理啊,入库啊,入库完了之后你还要有一个BI团队做分析啊,分析完了以后要有一个前端啊,或者你有一个跑BI啊,或者其他低码去拖拉拽整个前端,呃这样一个开发流程,基本上需要一个小实人团队干上1~2个月,呃,成本是非常高的,那现在比如说我现在做这个行业,全国文宣行业信息化这个平台,诶,其实我前期把我的需求梳理之后,直接选择了这个网站开发啊,就是咱们用我8月的时候他有一个,呃。
02:14
网站开发,比如说就是新建任务代码开发,网站开发,这个他会调背后的一些对应的skill或者说专家啊,这样的话,他做网站开发会更专业一点啊。然后我们再回来你会看到,嗯,我的这个需求其实是其实是用,呃,也是用,也是用这个提示词的优化,优化后的他的需求会更加的明确啊,然后。我们啊,在给大们营传的时候,核心功能一定要有,这个是比较关键的啊,然后还有一些筛选啊,这个也是比较关键的,然后呃,给到他以后,他会先做一个架构,因为你选了这个网站,他背后应该是有啊,类似于开发这样的流程的skill,所以他会有一个架构,才会交互能力啊,才会一个配色啊,然后给你生成一个出版的,嗯,其实他一开始有问题的,因为我前面没有强要求他去真实数据,所以他第一版。
03:12
呃,是完全是假数据,所以我让他去,呃采购网去查询,让他做一个啊,做一个这个这个Python查询。这个也是非常简单,给他一句命令就可以啊,下来就是,哎,但是问题又来了,直接被反扒了,我的IP被封控了,所以这里给他提了一个新的要求,然后我和巴其实还不错,我和巴其实它呃切了一个低频啊,低频的爬虫技术,然后。呃,再往下它会把数据加载到一个杰S啊,这个是他自己走的一个技术路径,因为本地嘛,本地就没有数据库,比较好的路径就是杰层存储加s light啊,就这套路径,呃,然后下面是他的整体的进度,因为我让他有一个两天,呃,应该是我让他有更新任务吧,看一下啊,他这里是一个哦。
04:04
每这2天自动给你爬行,这对。然后自动保存到这里。呃呃,然后这里是也出来一个问题,因为前端他发布的时候,端口应该是跟我别的项目冲突了,然后有一个这个占用,所以我让他自检了一下,呃再下来的话,呃其实到这里已经差不多了,因为呃对这里的时候我要检查啊,它的数据在哪里,呃其实我还手动去查这个数据,这个角色里面,呃它是有这个数据源,你是可以跳转链接去对比它数据啊,基本上爬的都还是不错的,就是这是准确的,能够核验的啊啊然后其实大量的工作是让他去修正这个数据,呃其实它的前端功能反而我认为在这个开发当中啊啊它第一步,呃,你用了这个网站,呃开发这个模式之后,它其实功能还是不错的,呃问题是这个,嗯爬虫问题比较多,最终其实前面啊,前面的数据爬虫一直不是很满意啊,包括提示词优化,包括这关键词优化之后,最后其实是这个啊。
05:09
就是这个webpach这个,哎,这个用了切到这个技术,我再没有被风控过,就我的IP没有被封过,然后爬到的数据还是不错的啊呃下来就是呃,遇到一个新的问题啊,就是首次打开数据不加载不更新。啊,这是一个典型的bug,选了部位才有,那这个又开始修bug,修完bug之后啊修啊对,刚刚是那个数据不更新,修完那个bug之后,然后我让他补充了5月数据,再下来就是,呃,再下来就是还有一个问题,就是数据不同步,刚刚说两天两天更新一次,呃,两天更新一次,但是它的这个呃,它的这个打开又不出来,好,这里又出现欧问题了,就预算,所以用我们8D开发呃产品它是会有bug,但是你修bug它又会出现新的bug啊,然后呃。
06:07
但是这些都不难,其实难不倒他,基本上你描述的比较清楚的话,描述你看我,我明确告诉他,只要公开招投标肯定是有金额的,他一定是要么是杰森出了问题,要么就是爬虫出了问题,他这个应该是,呃,爬虫爬的是正确的,但是杰森用斯拉的取的时候取错了,因为当时他在分析的时候,我是能看到他的过程的啊啊。然后。再往下走,再往下就是这个数据更新的问题了,就是打开的时候数据更新不了啊,实际上呃,实际上后面他是给我做了一个脚本啊。啊,这中间都是他有的一些问题啊,嗯,然后对最后最后我呃就是就是杰森更新之后,你打开你的本地的HTM,因为HTM本身它是一个打包的一个这个呃相当于是把你的静态数据打到HTM文件里面,然后呃在前端这它不是一个像我们正常开发是前端后端对吧,域名直接访问前端服务,然后数据的后端拿,它不是这个完整的项目,所以它会存在呃一些下面这些数据更新的问题啊,当然我觉得我把给的这个方案还不错,他其实最后是给了我一个呃自动化脚本。
07:25
啊,自动脚本就模拟的时候,模拟的就是用s light去从这个啊对,就是个启动看板,完了之后啊,你再去打开这个dashboardt啊,它就更新了啊,所以到下面就是啊啊到这里结束了,其实这就是整个的开发过程,然后我们可以看一下结果啊,嗯,我觉得结果还是挺让我惊艳的,就是我觉得我拉,嗯,怎么说,反正这个表现还是不错的啊,首先数据我是合了的啊,这个数据你说他少他没有问题,但他爬到的是正确的啊,他有可能少,但是他爬到的这些是不错的啊,然后他自己也会检,检测到多少数据,缺少了重点单位信息,然后检测到多少。
08:10
高于平均值,这就是他自己,呃,拿到数据,他他对平均值的一个检验啊,然后呃,我给他的需求里面是上面这些是有的,然后这些啊有的有有的他自己补充的啊,里面的类型完全是他根据数据自动去规划的啊,包括这些我们可以看一下,就首先总揽啊,总揽下面有这个重点项目的媒写啊啊然后接下来是项目阶段看板,呃,这个主要是把项目分成几个阶段,但是合同签订没有,这个我觉得可能是跟这个公示的信息有关啊,所以导致合同签订没有啊,然后的话再下来TOP100的榜单啊,这个其实是按金额top的啊,这个因为我们重点关注的就是这个金额,然后top榜单还有一些分布的情况,然后还有就是按三室一厅省厅这个稍微有点问题啊,就是你看他这个明显这个。
09:06
这个字段名地域啊就就挤到一块儿了,而且下面的明细也没有给出来啊,下面明细没,所以这这个台谱也是做的有点小问题的,然后头部部哎,这个也还是不错,这个其实里面的功能我都没有给他规划,你像刚刚我的提示测,但是他整个出来的就我就感觉他我巴那好像就知道这种BI大屏需要哪些数据啊啊,上面是看板,下面是微信。然后信息化专项,信息化专项里面少了一些分布和阅读趋势啊,但阅读趋势转会也没有几个月,只爬了5月6月,呃就是爬虫是最费时间的,我基本上呃,因为避免反扒爬一个月的数据大概100多条,就得花费我基本上就近一个小时的时间,呃,可能不到一小时吧,但是也有半个小时多了,呃然后比较耗自己的CPU,因为这个Python脚本执行的主要靠你CPU,所以这是整个的这个产品落地的情况啊,再回到沃克发点,嗯,所以我觉得我派真的还是很惊艳啊。嗯,今天先分享这一个产品,其实最近我还用它做了很多,呃别的产品像一些诶过去啊需要策展的啊啊像结合我巴的AIGC能力啊,结合一些这个它比较呃强的一些,这个s skill他确实做出来效果还是非常不错的啊啊,那这个案例我觉得呃。
10:28
本身就已经很惊艳了,而且呃,这里的抓取信息啊,和行业和和这种BI,它是完全可以支持你去定制的,那以后这种大屏啊,或者从爬虫爬取数据到大屏,是不是就不需要开发团队啊,这个其实也是值得我们思考的。好,今天就分享到这里。
我来说两句