Axi's Blog
大三回忆录Blur image

回忆录

前言#

我正在一辆开往西安的列车上,匆匆写下自己对于大三的回忆。准确来说,大三或许是很多事情真正意义上的起点,我对于科研的真正探索,也主要是在大三展开的。

在大二暑假前往上海人工智能实验室实习之后,我基本上已经确定了自己的去向。事实上,当时能在大二拥有一篇顶会一作中稿,同时排名和学校还算不错,即使对于上海人工智能实验室这样已经很好的地方来说,也算是十分少见。对于本科生来说,距离保研只有短短三年,而论文从开始到中稿需要相当长的周期。更多人或许已经拥有充足的能力和见解,也有论文在投,但距离真正中稿还差一些时间与运气。

在众多条件的加持下,我在实验室中心主任眼中自然也就成了相对不可多得的好苗子。再加上我频繁表达非 SHAILAB 不去的意向,基本上只要能够顺利获得保研名额,剩下的事情便不需要我操心了。

怀揣着半个 Offer,我回到了西安,开始了我的大三生活。

保持聚焦#

从上海回来之后,在西安的生活可以说是按部就班。从保研的视角出发,当时的我算上加分可以领先保研线七分之多,学分绩本身又已经积累了大量学分作为缓冲。这意味着只要我不考出足以挂科的成绩,让自己直接失去保研资格,其他事情基本都是绰绰有余的。

大三对于大多数同学是一个显然的分水岭。越来越多人开始接受现实,重新规划自己的学习和未来:究竟是继续挣扎保研,还是干脆准备考研。也正是因此,我观察到身边越来越多的同学开始正式进行科研,而不再只是做一些比较 toy 的探索。

当然,从我的视角来看,似乎大多数的科研还是以「水论文」为目的的,直到学年结束拥有论文发表的同学似乎也只是凤毛麟角,不过 anyway,这并不重要。

对于我来说,当务之急是对手头的事情进行剪枝并保持聚焦。当时主要的任务包括课内学习、本校尚未完成的科研课题、SHAILAB 的远程实习以及 RM。

其中被首要剪枝的自然就是 RM。尽管大学前两年我一直很喜欢 RoboMaster,也和许多同学共同度过了非常愉快的时间,但从事实上来说,我已经不再需要 RM 带来的加分和相关优惠政策。众多科研任务也让我几乎没有时间继续跟着队伍去外地参加比赛。不过尽管如此,我依然担任视觉组组长,跟踪大家的进度、给出关键建议,并完整带着新成员完成了前期培训。

我一向认为自己在向别人讲解内容这方面具有某些天赋,尽管似乎有一些口吃。从 Linux 基础一路讲到计算机视觉,以及后面一系列优化相关的内容,我自诩完成得还算不错。不过除此之外,RM 对我来说的意义,大概也就只剩下提供一个 24 小时开放的宽敞工位了。

第二件需要剪枝的事情自然是本校科研。大二下学期,在本校老师的 idea 指导下,我开始了对一个如今看来没有任何价值的方法进行长达半年的调参优化。不同于第一段由我自己提出 idea 的科研,这篇工作更多由老师推动,整体是 meta learning 故事线下的某种参数优化。然而半监督场景中的训练极不稳定,导致我长期疲于调参,浪费了大量生命。

本校以 ICLR 为目标的科研,与 SHAILAB 以 CVPR 为目标的科研同步推进时,毫无疑问是我最痛苦的一段时间。甚至十一假期前往米兰参加 ECCV 会议的途中,我还在修改 ICLR 的论文。

无论如何,论文最后成功投稿,也拿到了意料之中的低分。毕竟方法本身近乎一个 trick,我也早已失去继续做下去的动力。之后老师建议把这篇工作与此前 ECCV 中稿的论文合并,改成一篇投稿 TMI 的期刊论文。尽管它看起来几乎必中,我却已经身心俱疲。

于是我提出了一个自认为妥当的建议。当时本校老师正在扩招,大概是前一年我凭个人实力拿下的顶会中稿,让老师认为增加科研实习人数可以带来更多成果。因此可以让几位新来的同学负责论文写作,毕竟两篇论文都已经拥有充分的实验结果和故事;我只负责 track 整体进度并给出建议,同时也愿意在作者位次上作出很大妥协。

然而事实上是——我要带着至今仍然存在的怨气给出辛辣评价——我的水平确实远远超过组里所有实习同学。在材料已经十分充足的情况下,仍然是我在 Overleaf 中导入了 TMI 模板。两位自称愿意投入时间的同学只给项目带来了约等于零的进展,几乎全部文字都由我添加;他们那些看上去很多的更新,只是把我原论文中一模一样的文字复制进模板,甚至懒得润色。

最后,我与项目彻底切割似乎是显然的结果。伴随着进入新的领域,以及对整个人工智能发展的更多思考,我越发认为继续发表医学影像论文对自己没有任何帮助。为了避免后续的纠缠和利益纠纷,我选择直接放弃项目相关的一切内容:他们可以访问全部代码与实验结果,而我完全退出,不再参与任何跟进,之后无论如何发表也不需要我的署名,从此完结。

至于学校的课内学习,大三内容逐渐回到了我熟悉的领域,包括 CV 与 NLP 的基础知识,以及 PyTorch、服务器等技术栈的使用。这些实在是我的舒适区,于是我基本游离在课堂之外,在课上推进科研,同时一心二用跟上课程进度。

自此,我终于可以保持聚焦,把 focus 放在 SHAILAB 的科研上。

ECCV 参会,小憩#

在推进上述事情的同时,我也参加了 ECCV 会议。这一届 ECCV 在米兰召开,意味着我需要提前办理申根签证、购买机票、申请报销,再走完学校与外出相关的一系列流程。算是费了九牛二虎之力,我才终于和两位西交的师兄一起前往米兰参会。

首先印象比较深刻的是意大利的天气。可以带着引号地说,国外的空气确实「香甜」几分。出发时西安正午还比较炎热,只有晚上稍微有些冷;到了意大利,下飞机便是一股恰到好处的凉爽。米兰这座城市并不算十分现代化,很多地方更接近古朴的小镇,一路上视野开阔,确实有种秋高气爽的感觉,让人身心愉悦。

这座城市里还有不少我此前没想到会亲眼看见的东西,包括有轨电车、无处不在的信用卡支付与机器吐出的大量发票,以及数量超乎想象的欧式建筑。不知道算意外还是幸运,我在米兰期间也没有遇见传闻中的治安问题,基本上一切平安。

我还参观了米兰大教堂,那是和国内完全不同的一种华美。无数精细雕刻共同组成一座庞大建筑,带来的视觉冲击感确实难以言表。

这几天大部分时间都在会场,晚上则回酒店写程序、准备之后的工作,因此几乎没有认真逛过城市或景点。所谓的当地美食倒是吃了一些,不过和国内确实相差甚远。

比较有趣的是,我住的酒店里有一个浴缸。国内酒店一般使用淋浴,可以泡澡的浴缸似乎只有更高端的房间才会提供。因此,在用热水把它反复清洗五六次之后,我开始了为期六天的泡澡生活。我有些难以形容那是一种怎样的感受。

写代码写累之后,整个人躺进浴缸的温水里,感受浮力轻轻托举着身体。卧室的窗半掩,微凉的风吹拂进来;我把半个头埋到水下,能感受到凉意微微刺痛皮肤,而水的温度又令人心安,思绪也不禁飘向远方。

另外再分享一些意大利期间的碎碎念。会场的饭确实很难吃,我尝过一次之后便没有再考虑;零食倒还不错,有糕点和巧克力,我经常过去品鉴一番。出国这几天也提升了我的口语水平。虽然口语确实不好,但现在有了使用的刚需,只能硬着头皮表达,至少可以和外国人讨论自己熟悉的学术问题。

最后我的 poster 顺利展示了,不过 present 到一半便提前离开。紧张是一方面,更多还是精神状态很差:抵达米兰后的前两天作息还算正常,之后又飞快变回熬夜,展示时实在头晕得厉害。

在意大利的几天可以说十分 work-life balance,以至于周日回国之后,我立刻陷入了极大的不适应。后来想了一下,两边唯一的变量大概就是学校。新出现的 ddl 依然主要来自课程作业,那些不会对未来产生任何帮助的内容,无尽地侵占着时间、浪费着精力,也不会给我带来什么收获。

新的科研#

在结束了米兰的小憩之后,日常的科研还在继续。

上海人工智能实验室这边的科研需要获得新的进展。事实上,暑假期间我已经做过初步准备。当时我们认为 VLA 领域尚不存在成熟、可泛化的端到端模型(事实上现在也没有出现),因此短期内会涌现一系列模块化、类似 agent 形式构建的方法。CoPA 和 MOKA 是当时比较经典的代表,它们基于成熟的 foundation model 与 VLM,完成一些需要泛化能力的任务。

在此基础上,我们判断这个即将兴起的领域需要一个完善的 Benchmark 来测试模型性能,GenManip 也就从这里产生。以现在的视角回看,当时的判断基本可以说完全错误。领域中出现若干值得训练的 Benchmark 后,研究者依然更关心遵循模仿学习范式的模型能否在榜单上获得更高分数。幸运的是,GenManip 最后发挥了其他更重要的作用。

可能部分是因为我在远程,这个由我主导的项目并没有像想象中那样顺利合作,几位合作者在代码构建层面也没有帮到太多忙。这同时暴露了我当时缺乏 PM 能力的问题。不过无论如何,在若干煎熬之后,CVPR 还是成功投稿了。

投稿之后,组里陆续加入了两位核心主力 fangjing 和 jinhui。两人和我、mentor 伦哥、工程师 bolun 以及坤哥,共同构成了后续推进主线的核心班底。

CVPR 的 rebuttal 有惊无险,评分从 4333 Re 到 5442。由于疏忽,我们没有回答一位审稿人比较关注的问题,因此与可能存在的 highlight 失之交臂,不过论文还是顺利中稿了。

尽管 GenManip 在论文中的 scope 已经足够不尽如人意,我们还是迅速意识到它作为可扩展数据引擎的可能性。原始版本本就支持部分数据合成功能,经过大量优化和 coding,我们实现了通用的 Pick and Place 数据合成,可以在各种 scene graph 约束下,通过简单 config 在特定或完全随机的场景中生成大量数据。

当然,实际进展并没有描述中那么顺利。期间我们遇到了两个十分恶性的 bug,整体进度因此延后了接近三个月。

第一个来自训练不稳定性。我们最初选择字节的 GR1 模型作为 baseline,但它极度不稳定,即使使用相同数据训练,结果也可能存在巨大偏差。复现此前性能已经十分困难,更不用说在此基础上继续迭代。最后 debug 无果,我们切换到 GR00t,问题也就迎刃而解。

另一个则是仿真器的物理问题。我在其他地方也描述过类似现象,大致可以理解为处理 Objaverse 中大量 messy 资产时遇到的麻烦。部分资产在物理仿真中并不稳定,物体互相穿模后,会因为斥力突然飞出去。问题并不完全由物体形状决定,因此无法通过一种程序化方法提前区分稳定与不稳定资产,只能继续调试仿真器。按照 Isaac Sim 文档开启 CCD 后,问题看似有所好转,并且很长时间没有再次出现。直到我们几乎忘记它可能与后续 bug 有关时,更严重的问题发生了。

机械臂的夹爪在某些物理接触下会与机械臂本身分离,仿佛不再受到 Joint 约束。可以确认的是,我们的约束设置本身恰当,例如没有设置 Breaking Force 上限。若干尝试无果后,我决定使用 Sapien 进行物理仿真,只让 Isaac Sim 负责渲染。这套双端同步方案被我巧妙地设计进 Codebase,又花了半个月才完全实装。算上之前寻找解决方案的时间,此时已经到了五月下旬。

好在后来还是找到了原因,物理问题也通过其他方法得到解决。相关过程已经写在 Isaac Sim 博客中,这里不再赘述。

WAIC 风云#

到了 2025 年夏天,我们开始专注于所谓主线的交付。上海人工智能实验室十分重视 WAIC,这也是实验室一年一度发布重要成果的场合,因此我们团队同样需要准备若干交付。彼时 GenManip 的 Codebase 已经可以承担团队中的部分模型测试,Scaling up 数据也能够顺利合成。事实上,这项功能早在二月份春节期间便已完成,也能够生成不少数据,只是因为上述两个 bug 一直拖延至今。

数据引擎可以生成用于 VLM 和 VLA 训练的数据,GenManip 框架也能程序化生成 Semantic Mask、2D Bounding Box、3D Bounding Box 等中间表征,总体上可以为模型训练提供一些帮助。

相关代码基本完全由我完成,组里的好朋友 jinyu 负责挂数据,再交给坤哥完成清洗,最终得到 WAIC 期间较为完整的一项交付,也就是 InternData M1。

与此同时,我们组还需要交付一个经过大量迭代的模型。彼时好友 weiyang 加入组里进行暑期实习,和坤哥一起负责调优 VLM;另一个项目 RoboInter 注入了一些真机数据,InternData M1 则提供仿真合成数据,再加上常规 VLM 数据。在大脑的基础之上,我们还需要训练一个小脑,或者说一个完整的 VLA 模型。

此前提及的 fangjing 和 jinhui 在 2025 年上半年进行了大量迭代,最后整个团队协作完成了 InternVLA-M1,也是目前中心交付中非常 Ready 的 VLA Manipulation 模型。技术报告一直写到九月份,期间诸多颠沛不再赘述。团队做了大量真机实验,模型聚焦 Latent Planning,并对 VLM 与 Actor 进行 Co-training,在一定程度上保留了模型的泛化与通用能力。

后续从这个 Codebase 衍生出的 starVLA 也成为风靡一时的仓库,无论接手 VLA 训练的团队还是 Qwen 团队都在使用。

值得一提的是,在 InternVLA-M1 的技术报告中,我也算突破了自己,承担了画图相关的工作。无论相比上一次,还是此前医学影像论文中的画图,这次的结果都令我十分满意。实力进步可以说相当迅速,我已经能自称一个有品位的画图人了。当然,我同时还负责了网页与视频制作,这些算是老本行,效果也不错。

琐事若干#

在推进科研的同时,保研也顺利结束。就像前面说的一样,因为很早便在实验室确认了 offer,整个过程几乎没有悬念;再加上我简单复习了机试,最后成功进入上海人工智能实验室与上交的联培项目。

如今回看,一定程度上的远见让我规避了许多风险,也得以尽早达成目标。相比以前的自己,这可以说是一次显然的进步。

大三期间,我还认识了不少好朋友,其中一些人组成了一个小群,大家经常在里面聊天。因为基本都是科研出身,共同话题也相对聚焦,聊起来十分有趣。对我来说,现实社交基本只有乐小姐,偶尔再加上两位同年级同学,大多数时候都是独自一人;这个小群也因此填充了我的生活。

总结#

总体来说,这就是我大三的故事。继续在上海人工智能实验室实习,并且成功保研,大概就是这一年最主要的进展。大三并没有像预期中那样让我化身 paper machine,而是始终在迭代同一个项目,通过增加深度获得更多收益。

伴随着科研增多,我的学识确实有所增长,人却没有因此变得更加活跃,反而开始思考许多关于注意力以及当下时代的问题。这些迷思在之后一年里继续延续。不过至少现在来看,大三仍然是相对成功的一年:我达成了自己的目标,也获得了一些额外收获。

大三回忆录
https://axi-blog.pages.dev/blog/uni-memoir3
Author阿汐
Published atDecember 27, 2025
Comment seems to stuck. Try to refresh?✨