July 31, 2026

2026 July

2026 July

6.29 ~ 7.5

📖 Theme:Router Fine-tuned Model & Extractor Fine-tuned Model

🧠 Cognition

  1. 进行类似三分类微调注意训练集样本比例问题;
  2. llamafactory框架有时候可能会出现流程全部正常,但adapter文件保存失败,导致跑目标微调模型失效,微调完注意看adapter大小;
  3. llamafactory中yaml cutoff参数截断问题,超过cutoff的数据会直接截断训练,导致污染数据集,还要注意如果设置cutoff=4096,这里4096不是字符,要根据每个大模型的tokenizer进行计算实际值;
  4. 本地 agent cli 很容易犯的一个错误就是在将当前上下文泄漏,写涉及prompt相关项目的时候要尤其小心(可能会写入上下文部分名词以及莫名其妙的限制);
  5. 让 few shot 代替 规则堆叠(即为了提升某个模型的数据而一直更改prompt,容易为某个狭小的场合特调prompt,不具备通用性)。

🖊️ Boundary

  1. ✔ 2026 June 月总结;
  2. ✔ 小红书简介 + 第一篇开题;
  3. ✔ 三分类微调模型迭代八个版本成功分类(建立训练集和测试集 + 教师期望数据 + baseline数据 + 学生微调数据);
  4. ✔ 语义提取微调模型迭代四个版本测试集确立中幅度提升F2(Hard Sample 的语义提取与原zero shot的消融实验,且14b与32b都已测试);
  5. ✔ Easy Medium 原 few shot 实验。

🎉 Next Theme:Go on Fine-tune Model


🧩 七月第一周的碎碎念

这周最大的就是体验就是换了时差🌕,我发现很神奇的一个事情就是强大的起晚了内耗惯性没了,这是我二十四岁人生第一次倒时差生活,往往都困在早上起来状态如何的一种感觉,如果起来状态不好往往动力就很差,而如今中午起床根本无所谓了,就是那种早起的业力心态没了,好神奇,而且晚上十点后沉浸式工位独处也很舒服,晚上凌晨两三点一个人离开工位回家也很开心,充足的七八小时睡眠实际上身体并没有感到不舒服,只是换了时差。

果然啊,还是喜欢生活于社群之中,在工位的快乐又回来了,这样的生活还能体验两三年就感觉很开心,虽然如今要肩负比当年大一更多的责任,但也很期待接下来的生活。

这周主要就是在弄微调模型🤖,长达两个月的各种方案的尝试终于看到了希望,所以感觉来了就一直在微调,中间当然碰到不少问题,也让我意识到了前两个月的各种尝试得到的结论也有很多价值,三分类和trace语义提取都得到了正反馈,这等待已久的正反馈…下一步就是扩大测试集进行实验了,说实话不到完整测试集上跑完之前是不敢开香槟的,现在在我心里依然是悬而未决。

生活上每天真是伙食变好了,已经好久没去食堂了,附近好吃又性价比高的都吃了一遍,我甚至都好久没一个人吃饭了,嗯,上个三年真的结束了,如今每周还能约出来玩或是晚上打会game🎮,啊日子可真美好。

总的来说,自从上次月记结束,感觉一下子就加快适应了如今的环境,协会前两天还刚好大扫除了,我的工位又升级了,工位旁边还有个小床,准备收拾收拾升级一下就能睡了,如果今年研究生宿舍真在三公里的G区,那估计真三天两头要睡工位了🛌。

下周继续微调实验,争取这两周优化完确定完整个流程,就可以对比各种baseline后完成实验了,当然每次专注一个事物其他事情都不干了,但说实话不能完全放,实验做累了换换脑子也好,下周一定把小红书🍠第一篇内容发出来。


7.6 ~ 7.12

📖 Theme(本周主线一句话:这一周你在解决什么问题):Co2FuLL-Finetuning 2.X

🧠 Cognition(认知变化,理解变了什么)

  1. 规则是可以少量增加的,但所有样本跑完总是会有各种各有的小问题,我们是要抓住会影响代码通用点去增加规则;
  2. 如果要专门分析某些问题又不被上下文噪音干扰,可以新起一个codex去分析讨论问题,比起网页版的好处是可以让llm有更多上下文信息;
  3. 目前基线先要有提升空间,当感觉没有提升的了,就换一个角度想办法,比如时间角度、样本数量、方法等;
  4. 可以把错误样本优化一下进入训练集,相当于模拟卷放入训练集,真题放到测试集,到时候测试集里跑出来的错误样本特征都可以提出来放到训练集。

🖊️ Boundary(能力边界变化)

  1. ✔ Co2FuLL-Finting 项目流程优化,正式上传github记录每个版本迭代
  2. ✔ Co2FuLL-Finetuning 2.0
  3. ✔ Co2FuLL-Finetuning 2.1
  4. ✔ 新建 Co2FuLL-Extract 提取数据集
  5. ✔ 小红书第一篇月记

🎉 Next Theme:Co2FuLL-Extract


🥱 倦周

从周二打羽毛球🏸受伤开始,晚上没有灵感,没机会再运动,从台风要来开始,周末取消聚餐,哎。

刚好这周工位的人都回家过暑假了,这下子工位就我一个人了,公寓也无叶子🍃,又到了一个人的暑假时间…倒也不是一定有人在,想要的是有个人存在即可,但似乎我就得等到八月份有人回来,不知道剩下这半个月该怎么过,哎。

于是刚打完这段话就有人进来了,直呼woc,工位还是有人才开心,也要乘这个契机把时差稍微恢复一下,正好今天起的是最近最早的一次了,这周五又有高中同学生日聚餐,周末还要带着来杭玩的朋友出去玩一下,我的档期生活又要开始了。


7.13 ~ 7.19

📖 Theme:Co2FuLL-Baseline、Co2FuLL-Extract

🧠 Cognition

  1. 当任务不明确的时候,可以先讨论做出个plan,再开始agent工作;
  2. 对论文引用的原始数据库,做一个高度抽象,宏观描述该数据库作用,一个是以后可以复用,另一个是做emprical study要统一维度;
  3. 读论文自问三件套,形成论文体系;
  4. temperature 0:让模型尽量走确定性输出,减少随机性;格式更稳,解析失败概率通常更低;同一批样本重跑结果更可复现;对评测/路由分类更合适,因为我们不是要创意答案;
  5. Hermes Dist Similarity祛魅,HDS本身就用来挑选top5,可以排除一部分FN和FP样本,如果用来三分类或者跑baseline,小模型可能会通过HDS硬猜,不如论文最原始的few shot;
  6. 小模型输出原论文的标签格式最稳定,json可能容易出错。

🖊️ Boundary

  1. ✔ XM数据集 top20构建 + Few Shot Baseline
  2. ✔ XA、XC、XM top5构建 + Few Shot Baseline
  3. ✔ 构建 Min F2 测试集
  4. ✔ 构建历史错误样本特征库 + 提取FN、FP特征
  5. ✔ 构建 Train 训练集1.0、2.0、2.1 + Few Shot Baseline + 构建 Train 2.1 教师数据
  6. ✔ Router adapter 3.0、3.1、3.2、3.3 训练 + 三分类 Few Shot Baseline
  7. ✔ SoK论文初稿

🎉 Next Theme:Co2FuLL-Finetuning Trace


❓ 周吗

不得不说偶尔有些纠结时差,然而这个暑假我其实想几点睡都可以,我不必再受一些平常的社会时钟所束缚,感觉受社会时钟的束缚太久,都会惯性的焦虑一些这个暑假不用焦虑的事情,徒增烦恼。

又过了一周,由于工位在顶楼,算是狠狠的体验了杭州的夏天,一台空调根本顶不住顶楼的整个房间,白天还挺热的,工位也只有工作日才能见到人,不过再过两周好多人就回来了,到时候就有意思了,虽然不是很喜欢现在人不多的工位,但也该享受独自一人工位的自由时间。

这周脚伤好了很多,不过估计至少也要再等一两周才能运动,这点上还是挺难受的,运动带来全身放松与心情的转换这两周失效,自己一个人呆的也挺郁闷的,不管是工位还是公寓都是一个人,杭州的烈日也根本很难约出来玩,不过还有秋天、冬天和春天,新的一个大学三年又要开始了,噢,今年好运的是研究生住学校本部宿舍了,太开心了。

这周做实验感觉到了一个神奇的感觉,就是大概可以预测到本次baseline的结果,并不是猜,而是基于过往无数失败经验的合理推测,之前跑baseline像是在抽奖,或者是跑几百个样本就想看一眼,现在情绪很稳定了,整个测试集跑完我才看,局部结果不能代表整体结果。

这周也祛魅整个DBs了,理清了整个数据库的脉络,其实早该理清了,还是会本能性逃避未知,但其实这个未知一捅就破,现在整个原始项目才是自己搞清楚了,于是构建好测试集和数据集,后续的Router与Trace才能更得心应手的展开了,这周Router3.3的结果比我想象的要好,这倒是惊喜的一点了,下周要是攻克Trace,这长达两三个月独自一人调研 + 搭环境 + 跑Baseline + 迭代方案总算是有回报了,当然导师也在每周的讨论中给我点出不少地方,少走了一些坑与指明了一些方向,有人讨论真好。

不过这几个月做的最正确的决定会提前入校了,果然还是在工位状态会好很多,我依然记得五月初在家半死不活的状态,现在尽管会不在状态,但在新环境总是能托住我不会太糟糕,真的很想好好享受这个暑假,相对来说压力没有那么大,朋友好多可以约,没有杂事,只有自己想做的事,现在我要去拿我的抹茶暴风雪了,因为不用管明天几点起,所以我晚上也可以吃抹茶。


7.20 ~ 7.31

📖 Theme:Slice Tree -> Algorithm Tree、SliceCode -> Segment Trace、Judger

🧠 Cognition

About Experiment:

  1. 让ai用python结合画图专用库先生一个代码图,再转图,这样构建论文的图会更好看一些;
  2. 跑单次请求一定要注意temperature,减少每次的随机性;
  3. 加了complie后的效果模型更倾向打positive,因为会把差异解释为编译原因而不打negative,所以对于tree来说是需要更多positive成立,trace需要更少negative也成立;
  4. Few Shot的构造:不用特意找FN和FP,找稍微复杂点的例子即可,保持通用性让llm理解一般性操作,而不是特殊例子特意判别,而trace或tree这类不太需要few shot,本身输入就是构造过的;
  5. Trace方案最大的问题就是总结了代码行为,但失去了内核,归一化导致部分FN和FP,可以说trace方案对部分pair就是无法解决,也就是只看到外壳,真正函数行为细节藏在里面;
  6. Algorithm Tree的特点是FP较少,FN多;而Trace的特点是FN较少,FP多;于是通过当前workflow,划出来的最后一部分样本就是Algorithm视角下的的FN与Trace视角下的FP了,这部分冲突样本就是最后可以提升的地方了;
  7. 如何判断方案的通用性?同一套方案换更好模型能能稳定效果,或部分提升;
  8. 目前各种实验各种大方案小方案,一个比较适合路径是头几个版本先做各种想法探索,确认哪个版本最优,再往该版本继续优化,而不是每次都是一个新版本;
  9. 当陷入反复改prompt而F2左右浮动不大,就说明该方案的局限就在这了,就需要换角度思考了;
  10. 经过这么多次实验,显然BCSD问题在小模型上很难通过单一方案来同时解决FP和FN,所以无论是对哪个样本集,都需要多方案融合,目前的测试下来一个比较有效的WorkFlow就是 先通过FP较少方案确认同源,再通过FN较少方案确认上一步删选后的FN+TN,拯救FN为主。

About Finetuned:

  1. 让微调进可能保持精而细的方向,如二元三元问题,这样就算局部小失误也不会影响大体,也就是微调时尽量减少噪声,让小模型学到真正需要学的;
  2. 训练学生时可能不需要few shot,因为毕竟所有教师数据都是学生的few shot;
  3. 微调时教师模型输出多字段,学生训练可以学习,但学生输出只输出少量字段减少学生压力。

🖊️ Boundary

  1. ✔ Trace 3.x、4.x、5.x、7.x 版本规模数据实验
  2. ✔ BWTAC 定稿,格式调整,已上传论文
  3. ✔ Co2FuLL-Flat 方案调研与夭折
  4. ✔ Co2FuLL-Slice 方案与盘活 + Slice 6.x 规模数据实验
  5. ✔ Algorithm Tree 6.x 规模数据实验
  6. ✔ Router3.3 + Slice 6.4 + Algorithm 6.4 + Trace 7.1 Teacher Hard&Medium 大规模数据测试

🎉 Next Theme:Judger Verdict & August Reset


🔥 七月记

六月的三天一聚,虽然让我疲惫,但体验起来要开心的多,七月份基本没什么聚餐了,想想六月份聚餐那么多也是因为是毕业季+还没那么热,而七月份的杭州要把人炼化了。

记得上个月给这个月的主线任务是微调模型,其实成功了,至少Router上是成功了,然而三分类其实一小步,后续就探索真正的难题了,如何提升F2呢,其实Router成功后我直接想到Trace方案了,可以说是基于前两个月的各种方案失败与想法碰撞水到渠成的想到了,实验了一下果然有提升,以为就要赢了,然而扩大测试集发现提升有限…

于是又折腾了一周训练集和重构测试集,Router再一次成了,Trace的提升果然还是有限,经过各种尝试改善Trace方案,改到后面感觉要放弃Trace方案,与导师讨论出Slice方案,突然顺理想出了Algorithm方案,经过融合方案,终于在Trace的基础上又提升了,可以说这套方案的期望上限就是这次论文目标了,如今剩下最后的Judger就是最后的问题了,答案已经在自己手上了,就看能不能把握了。

这几个月实验最大感觉还是对大模型祛魅了,实际上各种实际的突破都是自己想出来或者和导师讨论出来的,模型只能帮我完成工程化的事情,让模型完成一个没有现成方案的目标还是有些不切实际,当然如果有无限token,再给模型配上服务器,让他自由探索实验,maybe会成,但成本非常大,类似于agent群聊,这下子idea都不需要人类想了,尽管对模型祛魅,但我对LLM时代我依然是悲观主义,事实上很多实际工作都是有现成方案的,模型发展到一定程度就能做到,或者说等成本压下来,模型自然就能干掉很多工作。

当年没选择工作而是选择考研的一个好处就是现在能规避前线LLM风险继续学习吧,能在学校部分规避时代的浪潮,压力没那么大,还能凭着兴趣去探索想学习的东西,而不是赚钱导向,可以说下个目标实习岗位不再说逆向而是更新时代一些岗位,可以去探索一些新的范式,多少有些期待呢。

关于上个月的其他目标,小红书还是不知道发什么,可能是没有正式开始读很多论文,主要还是在做论文实验,所以如科研,又好似在干工程活,其实目前类似于调研方案 + 实现方案 + 测试实验修改,这样反复一轮又一轮,在方案完成之前的确没什么好分享的,继续沉淀吧。

这个月也是真的一点逆向没碰,无论是书稿还是上个月想逆的APP,其实还是有时间做的,只是那部分时间拿去玩了,emmm,好歹也是我的暑假,这个月的综述也是,ddl快到了才开始完成,其实挺快的,目前唯一的主线可以说就是完成论文实验了,在这之外就是享受最后的暑假!七月记。

About this Post

This post is written by P.Z, licensed under CC BY-NC 4.0.