Uncle Bob Martin 写了快60年代码。他最近在网络上分享了一个操作,原话:
范围(做什么)+ 约束(用什么技术/已有代码)+ 完成标准(怎么算做完) 三个缺一不可,否则 AI 会开始"发挥创意",而那通常意味着你要多花两倍时间 debu...
讨论 AI 编程时,最常见的问题是:它能让开发效率提升多少?是 20%、30%,还是翻倍?
昨晚,傅盛一场关于AI智能体“龙虾”(三万)的直播,刷爆了科技圈和职场人的朋友圈。没有花哨的噱头,没有刻意的营销,全程围绕龙虾的真实执行场景展开,却让所有人直观...
我们介绍了 MIRROR,这是一个包含跨越四个元认知水平的八个实验的基准,旨在评估大型语言模型是否能利用自我知识做出更好的决策。我们使用五个独立的行为测量通道,...
代码正在变得越来越容易生成和修改。一个任务可以在 Loop 中持续推进:测试失败后,Agent 会读取结果、继续修改并再次验证;多个 Agent 还可以围绕不同...
2026年年中,AI编程Agent工具的格局已经相当清晰。Claude Code凭借深度代码理解在复杂重构场景站稳脚跟,OpenAI的Codex在年初完成了从“...
做过几年持续交付的人大概都有过这样的经历:流水线跑了半天全绿,信心满满地点了发布,结果线上一上去就炸了。要么是某个边界用例没覆盖到,要么是第三方依赖出了安全漏洞...
功能看起来都能用,代码也可能通过编译。但几轮对话以后,同一个概念出现两套命名,两条路由和三种默认值。下一位开发者已经说不清哪一个才是事实来源。
和 AI 打交道时间久了,我有种感觉:AI 真正难的不是“会不会做”,而是“做完以后,我们敢不敢相信它”。
前两天在群里面,一个自己创业做 To B 业务的朋友吐槽:他们之前和一家兄弟公司合作做一项新业务,双方加起来只有几个人,做了大半年之后,内部已经基本用起来,也开...
Nesso-1 是一个面向结合亲和力预测的粗粒化共折叠模型。它删除了 Boltz-2 一类模型中计算最昂贵的全原子扩散生成模块,用蛋白残基中心、配体重原子及其成...
如果再严格一点,验证层可以分成四类:API 测试、功能验收、回归测试、工程验证。API 测试看功能正确性、权限控制和数据校验;功能验收用 Playwright ...
他不是在赌运气。他后面跟了一长串条件:单元测试、Gherkin 验收测试、QA 流程、质量度量、变异测试、测试覆盖率……
Stage-0 只做一件事:两边都用官方默认配方,同一数据、同一硬件、同一 held-out 测试,立下后续所有优化文章都要对齐的基线。
这篇专门做「翻盘实验」:固定同一批 held-out 测试图,用 1 张 / 5 张 金属条标注微调 YOLOv8s,看命中率能不能从 0 拉起来。
25 正常训练 · 42 测试 · WRN50-2 · RTX 5060 Ti · 2026.07
例如,开发者可能会让 AI 生成一组单元测试,但仍然要判断这些测试是否覆盖了关键边界;会让 AI 修复一个 Bug,但仍然要确认修复是否破坏其他路径;会让 AI...
在 AI 编程工具刚开始普及时,大多数人的使用方式都很直接:向一个模型提出问题,然后等待它给出答案。比如让它写一个函数、解释一段代码、生成一个测试用例,或者帮忙...
质量工程强调共同负责,但责任必须具体到活动。产品人员负责澄清业务规则、异常路径和验收条件;开发人员负责单元测试、组件测试和可测试性;质量工程师负责风险模型、测试...