过去一段时间我们团队把相当多的注意力投向了cfDNA。手头这张工作账号的Token活动截图显示累计101.6亿Token连续使用64天日均约1.59亿Token。这只是一个工作账号的统计不能代表团队所有账号的汇总。文章目录一、单细胞的问题已经不只是“还能测多少细胞”二、为什么我们看上了cfDNA三、cfDNA并不与单细胞对立它甚至需要单细胞四、为什么说这条赛道“看着简单”却仍有方法机会五、从发文章看不必跟资源型科研硬拼规模六、从临床看抽血改变的是决策机会不是医学定律七、从商业看市场会奖励“少折腾”但不奖励空泛承诺八、我们希望把这1.5亿Token花在哪里参考资料与图片来源如果按OpenAI官方API标准档价格做量级换算以gpt-5.6-terra为例输入价格为每百万Token$2、输出为$12。假设这101.6亿Token中70%为输入、30%为输出并暂不计算缓存折扣Token费用约**$50,8005.08万美元64天平均约$794/天**。若假设全部按输入计费约$20,320全部按输出计费约$121,920估算不含单独计费的工具调用。截图没有模型、输入/输出和缓存拆分因此这只是估算Codex Pro订阅不等于实际支付了这笔API费用。这不是实验结果也不是一张可以证明研究水平的奖状。它只能说明我们确实在持续阅读、写代码、复核公开数据、推倒假设再重新寻找更有价值的问题。我想把态度讲得直接一些未来几年生物信息学最值得投入的地方未必是把图谱做得越来越庞大。**真正有价值的突破可能发生在一个很窄的临床问题、一种反复可得的样本和一个长期没有解决好的测量环节之间。**我们把cfDNA放到中心位置就是因为它恰好处在这样的交叉口。这不意味着单细胞已经没有价值更不是鼓励所有人转向同一个赛道。我只是越来越不愿意接受一种论文逻辑采更多细胞、分更多簇、画更密的通讯网络文章就自动更深。数据体量值得尊重但它不能代替问题意识。一、单细胞的问题已经不只是“还能测多少细胞”我做过不少单细胞相关研究也知道它的贡献。没有单细胞我们很难在许多复杂组织里区分细胞状态、理解稀有群体或为后续研究建立可用的参考图谱。空间组学、扰动实验、长读长单细胞和多模态测量也还在快速推进。因此所谓“单细胞到了技术瓶颈”更准确地说是一部分常见的应用型研究写法遇到了边际收益瓶颈。同一类疾病继续把十万细胞扩大到百万细胞当然可能发现原本看不到的稀有状态。但如果每篇文章仍停在“重新聚类—命名亚群—拟时序—细胞通讯—挑一个基因做模型”细胞数上去以后核心问题可能没有前进一步。它只是让熟悉的流程运行得更大、更慢也让图更精致。更需要警惕的是统计单位错位。**十万个细胞可能只来自十几位患者。**如果要推断患者间差异细胞不能自动充当独立患者。Zimmerman等人在《Nature Communications》讨论的“伪重复”问题正是这种错误会放大显著性、影响可重复性的原因。我们应该问这个亚群到底对应哪一类患者疾病进展时是否稳定存在采样时间、用药、组织处理方式会不会改变它能否在独立患者和另一种测量方式里再找到它如果这些问题答不上来增添细胞数量带来的更多往往只是分辨率不一定是解释力。我期待新一代测序和单细胞测量继续突破更完整的转录本、更可靠的表观与蛋白信息、更低损伤的空间定位、更可重复的纵向采样。这些进步会改变我们能提出的问题。但在工具到来之前我们也应该承认一张颜色越来越漂亮的UMAP不等于临床问题已经被推进。二、为什么我们看上了cfDNAcfDNA是细胞释放到血液等体液中的游离DNA其中来自肿瘤的部分通常称为ctDNA。它看似只是血浆里短短的片段背后却叠加了细胞死亡、组织来源、核小体保护、酶切过程、甲基化状态和肿瘤基因组改变。同一管血既可以问“有没有某个突变”也可以问“这些片段来自哪里、如何断裂、为什么此时出现在循环中”。这正是我们觉得基因组学仍有很深空间的原因。序列是底座但有价值的信息不止碱基改变。片段长度、末端位置、末端基序、全基因组覆盖、核小体相关信号和甲基化模式都可能提供不同的观察窗口。不过必须强调片段信号是染色质状态和组织来源的间接线索不能被直接写成某个患者某个组织的RNA表达或开放染色质实测结果。2026年一项低深度全基因组测序研究把拷贝数、片段分布、核小体及末端相关特征放到同一分析框架中用于癌种来源判别。图里值得看的不是“特征越多越好”而是同一份血浆测序数据怎样被拆解成互补而可检验的信号。Moss等人在《Nature Communications》建立了细胞类型甲基化参考图谱用血浆甲基化混合信号推断cfDNA的细胞来源。这类工作吸引我的地方不只是“做了一个模型”而是把“血里检测到变化”推进为“变化可能来自哪个组织、哪类细胞”。这种“来源”问题可以连接肿瘤也可以连接移植后组织损伤、炎症或其他器官状态。它不保证每一项研究都能做成临床检测但它给生信工作提供了一个比“找差异基因”更明确的对象究竟是哪一类来源的分子发生了变化变化是否随时间与疾病过程同步。三、cfDNA并不与单细胞对立它甚至需要单细胞更有意思的研究往往在两种技术相遇时出现。单细胞擅长建立细胞状态的参考地图cfDNA擅长在不反复取得组织的情况下观察循环中的信号。参考图谱越清楚我们越有机会从血浆片段中提出有生物学含义的来源假设。Stanley等人在2024年的《Nature Communications》研究中就把单细胞转录组参考与cfDNA片段覆盖、核小体相关特征结合用于推断血浆中的细胞类型贡献并在癌症等场景中探索疾病相关变化。这项研究不意味着“抽一次血就等于做一次全身单细胞测序”它说明了组织参考图谱可以服务于更容易重复获得的体液测量。在我们看来好的生物信息学不应该按平台划阵营。单细胞告诉我们组织里可能存在什么血浆告诉我们哪些变化可以被反复追踪病理、影像和临床记录再回答这些信号是否真正对应患者的病程。**每种技术测到的都是问题的一部分。**把它们接起来比争论哪一种“更高级”重要得多。四、为什么说这条赛道“看着简单”却仍有方法机会cfDNA的入门叙事很朴素抽血、分离血浆、建库测序、做生信分析。公开数据也允许研究者从片段长度、覆盖、末端模式和甲基化等维度提出问题。对一个没有能力自行采集百万细胞的团队而言选择已有真实患者队列、围绕一个可解释特征做深入分析确实比复制超大规模图谱更现实。但“问题入口清楚”绝不等于“测量简单”。肿瘤片段可能在早期极少有限血量决定了可观察分子数。采血管、离心时间、运输、冻融、建库方法、测序深度和比对策略都可能改变片段图谱。造血细胞来源的背景以及年龄相关克隆性造血也可能让突变信号被误读。2026年一项长读长cfDNA研究直接展示了前处理问题部分超长读段更可能来自混入的血细胞裂解而不是研究者想捕捉的原始血浆片段。测到“新峰”之前先得排除它是否由采样流程造出来。这里恰恰有方法学空间。我们更关心的是一个指标在不同采样批次和中心是否稳定端点或核小体特征究竟来自疾病还是实验流程模型在同一患者的纵向样本上是否有意义低测序深度下还能保留多少信息发生阴性结果时是疾病不存在还是该患者本来就不向血液释放足够的可检分子测序深度也不是一句“低成本就好”可以带过。2026年一项用cfDNA片段组学预测子痫前期的研究把片段特征与血细胞表达关系、不同测序深度下的稳定性一起检验其部分特征需要很深的测序才能稳定。这提醒我们每个特征的成本—稳定性曲线都应该用实际数据测出来。以片段长度为例肿瘤相关片段有时偏短但“偏短”同时受提取试剂、建库是否保留短片段以及分析时选用的长度窗口影响。一个实验室里成立的阈值换一套流程可能就失灵。端点与基序也一样若不记录采血到分离的时间、不检查白细胞破裂污染就很难判断分类器究竟学到了生物学变化还是前处理习惯。我们希望方法文章敢于把这些不漂亮的细节放进主结果。**这些问题很小也很难。**它们不像“再加一个模态”那样容易写进标题却决定方法能否真正走出训练集。Stanley等人的另一张结果图展示了癌症场景中的异常细胞类型贡献这样的解释性分析有潜力但依然需要疾病特异队列、合适对照和独立验证来区分信号来源。五、从发文章看不必跟资源型科研硬拼规模我们不反对大队列也不会把“小样本”浪漫化。真正的问题是资源有限的团队该怎么提出别人愿意认真读的问题。要和拥有跨国联盟、数十万患者、海量单细胞平台的团队拼总量投入未必划算但在一个明确场景中把定义、数据、统计单位、机制解释和外部检验做透仍然有机会贡献扎实的方法或结果。比如针对某一种治疗先明确临床决策点是治疗前选择、术后微小残留病灶监测还是复发预警。然后决定样本应在哪些时间点采集哪些患者必须有组织测序或病理信息健康对照是否足够良性疾病对照是否更关键。最后才决定测突变、甲基化、片段组学或它们的组合。问题在前算法在后。拿“术后会不会复发”来说设计时要先问术前血、术后第几周血和治疗期间血哪些能成对拿到在医生做治疗决定之前检测结果能否及时返回如果患者后来复发影像、病理和复发时间能否连到同一个人这几个环节没有打通哪怕从一管血里提取了上千个特征模型也可能只是在预测采样时间或中心差异。公开数据研究同样如此。数据下载量不是队列质量的替代品。原始reads是否可得、有没有真正的双端片段信息、患者与样本是否可以对应、病例和对照是否经过相同流程这些都应在选题之前核对。把不可用的数据硬塞进一个漂亮题目后面再复杂的算法也补不上最初的证据缺口。方法论文也不能只报一条好看的AUC。应当报告患者而非片段或测序reads为单位的训练与验证样本量锁定阈值后看独立队列报告不同癌种、分期和肿瘤负荷的表现检验批次、中心、测序深度和处理时间的影响。真正的增量不是比一个很弱的对照模型高0.02而是让临床上原本无法可靠回答的问题有了可复核的答案。如果连测量本身都缺乏共同标尺跨中心比较就更困难。2026年的一项研究制备了不同预设甲基化比例的cfDNA候选参考材料检查实测值与设计值是否一致并开展实验室间验证。它未替所有cfDNA检测解决标准化问题却把一个容易被忽略的环节摆到台前。我们也越来越愿意保留“没有成功”的结果。某个末端特征在训练集有信号、外部队列消失了就应该追踪原因某个指标只能区分晚期患者不能用于早筛就要承认其适用范围。这样的负结果不一定“好看”却能帮下一步研究少走弯路。六、从临床看抽血改变的是决策机会不是医学定律谈液体活检时我总会想到一个普通患者的反应假如肝脏有问题我也不愿意动不动就接受一次穿刺。**“今日割五城明日割十城”可以写成玩笑落在患者身上却是一次次真实的疼痛、风险、排队与等待。**血样的侵入性通常更低也更适合做多时间点观察这让我们有机会研究组织穿刺难以密集记录的变化。但不能因此写成“血液能替代所有组织”。组织病理提供形态、空间位置和诊断依据血液不一定能回答。血浆检测阴性也不能保证肿瘤阴性。美国FDA对已获批的部分血浆伴随诊断明确提示当血浆未检出相关标志物、而组织检测可行时应考虑回到组织检测。FDA Guardant360 CDx说明敏感度也必须放进场景里说。CCGA研究的一项独立验证中基于cfDNA甲基化的多癌种检测总体敏感度为51.5%、特异度99.5%I期癌症敏感度仅16.8%IV期则达到90.1%。这组数字足以说明“液体活检灵敏度不低”不能作为一条跨疾病、跨分期的口号。Klein等Ann. Oncol. 2021同样要分清任务上面提到的2026年低深度cfDNA研究在已经患癌的独立验证队列中对癌种来源的首选预测准确率为80%、前两名命中率为90%I期首选准确率低于IV期。这是癌种来源判别不是无症状人群的早筛敏感度。真实人群还会考验阳性结果的意义。PATHFINDER前瞻性队列中6,621名参与者有92人出现癌症信号最终35人确诊阳性预测值为38%特异度为99.1%。这并不否定早筛潜力但说明筛查后的复核、影像和诊断路径本身也是产品的一部分。2026年公布的PATHFINDER 2更进一步在32,007人的性能分析集中报告阳性预测值60.3%、特异度99.64%对12个月内确诊的全部癌症研究报告的事件敏感度为39.3%。这项前瞻性研究描述了检测表现与阳性后的诊断过程不能据此宣称已证明降低癌症死亡率。另一方面真正让人看到临床决策价值的例子来自更具体的问题。DYNAMIC随机试验纳入455名II期结肠癌患者术后ctDNA指导组接受辅助化疗的比例为15%标准管理组为28%2年无复发生存率分别为93.5%和92.4%达到了试验预设的非劣效标准。此后报告的5年无复发生存率分别为88%和87%。它证明的是在这一特定人群、检测方案与决策流程下ctDNA信息可以帮助调整治疗使用而不是“所有癌症都可以一管血解决”。DYNAMIC原始试验5年随访七、从商业看市场会奖励“少折腾”但不奖励空泛承诺液体活检的市场前景我认为确实可观。理由不需要建立在夸张的市场规模预测上更容易获取的样本、重复检测的可能性以及已经出现的明确临床使用场景本身就足以支持长期需求。美国FDA批准的血浆伴随诊断已覆盖若干特定癌种、基因标志物和药物组合说明这并非只有论文没有路径的概念。FDA伴随诊断清单但我不会说“抽血一定比组织检测更便宜”。一次穿刺和一次抽血的操作成本不同整条诊疗路径的成本却还包括采样、建库、测序、算法、质控、复检、影像、误报后的检查、漏报造成的延误以及支付方能否承担。若一个产品技术上可行却让医生面对一份无法解释的报告、让患者为每次追踪承担高额费用市场不会因为“无创”两个字自动买单。患者愿不愿意用也与报告的可理解程度有关。阴性意味着什么需要多久再测一次阳性是否必须转到影像或组织确认如果临床无法说明这些问题抽血虽然方便仍可能造成持续焦虑。对企业而言采样便利是入口真正形成长期价值的是可靠解释、可执行的后续路径和支付方看得懂的结局改善。真正有竞争力的产品应该把临床问题定义得很窄给谁用在什么时候用阳性后怎么办阴性后怎么办比现有流程增加了什么价值。在特定靶向药物选择中它可能帮助更快获得分子信息在术后随访中它可能帮助识别需要更密切观察的人在早筛中则必须把误报、漏报和后续诊断流程一并验证。不同场景不能用同一个“液体活检”标签抹平。至于汗液等更容易采集的体液我很愿意关注。它们在代谢物、蛋白或可穿戴传感方面已有探索乳腺癌汗液挥发物研究也已有21名患者的小规模初步尝试。但汗液研究不能被直接等同于血浆ctDNA临床检测采样量、目标分子浓度、污染、个体差异和临床验证都还要过关。把远景写清楚反而比把所有非侵入式体液并列成“成熟市场”更有说服力。汗液诊断综述乳腺癌汗液挥发物初步研究八、我们希望把这1.5亿Token花在哪里Token的消耗可以很大问题却应该越来越小。我们希望把工作压在几个可检验的方向cfDNA片段特征怎样与组织来源相联系纵向变化能否比一次性分类更早、更稳地反映病程何种预分析条件会让一个漂亮的信号失真一个公开队列中观察到的关联换一个中心、换一套流程还剩下多少。具体做起来第一步往往很不浪漫列清楚每一个公开数据集的来源、真实患者数、采样时间、治疗信息、可用的原始文件和不能回答的问题。数据表里写着“血浆样本”并不代表能做片段组学缺少双端信息、无法确认建库方法或同一患者多个时间点无法对应都可能直接改变课题边界。把这些基础工作做好比提前想好一个惊艳标题更重要。第二步是和临床伙伴把问题问得足够具体。医生说“想预测疗效”我们会继续问预测的是影像缓解、无进展生存还是某次治疗之后的早期风险结果要在几天内返回才有用错判阳性和错判阴性哪一种对患者更难承受算法只有进入这样的对话才有机会成为决策工具否则它只是一个离开电脑就不再产生作用的分数。第三步是把每一个看似微小的改进留下可追溯的依据。新的片段特征比旧特征好在哪里差异是否来自同一批患者的公平比较换一个公开队列是否仍成立都需要留下代码、参数和排除记录。我们不准备靠“每天用了多少Token”来回答这些问题。Token只是工具运行留下的痕迹真正的进度应当体现为更干净的数据、更明确的边界和更可检验的结论。这些工作最后要落到真实的患者单位上。病例数不够就说不够样本之间没有配对就不说配对只有相关性就不写成机制证明模型在外部队列失败就把失败作为下一轮方法改进的起点。AI可以帮助我们读得更快、试得更多但它不能把缺少的患者、缺失的时间点和不存在的临床验证凭空补出来。我仍然相信单细胞也期待更先进的测序和空间技术。只是现阶段我们愿意把更多时间放在cfDNA这样一条相对不拥挤、入口清楚、却尚有许多硬问题的赛道。对我们来说生物信息学最好的样子是把复杂测量变成对具体疾病过程更可靠的认识再让这种认识有机会减少患者不必要的侵入性操作、无效治疗和等待。日均约1.5亿Token值得讲但真正值得交代的是它将换来什么。希望下一次展示的不只是使用量的截图而是一项经得住跨队列验证、能回答清楚临床问题的cfDNA结果。参考资料与图片来源Zimmerman KD, et al. A practical solution to pseudoreplication bias in single-cell studies.Nat. Commun.2021.。图2使用其Fig. 1CC BY 4.0。Zhang等. Integrative cfDNA profiling from low-pass whole-genome sequencing enables tissue-of-origin prediction in cancer.Mol. Biomed.2026.。图3、图10使用其Fig. 1、Fig. 3CC BY 4.0。Moss J, et al. Comprehensive human cell-type methylation atlas reveals origins of circulating cell-free DNA in health and disease.Nat. Commun.2018.。图4使用其Fig. 1CC BY 4.0。Stanley KE, et al. Cell type signatures in cell-free DNA fragmentation profiles reveal disease biology.Nat. Commun.2024.。图5、图8使用其Fig. 1、Fig. 4CC BY 4.0。Berman等. Long-read sequencing identifies aberrant fragmentation patterns linked to elevated cell-free DNA levels in cancer.Genome Biol.2026.。图6使用其Fig. 3CC BY 4.0。Xu等. Cell-free DNA fragmentomics for preeclampsia risk assessment.Nat. Commun.2026.。图7使用其Fig. 1CC BY 4.0。He等. Development, characterization, and inter-laboratory validation of methylated human cell free DNA candidate reference materials.Clin. Epigenetics2026.。图9使用其Fig. 4CC BY 4.0。Klein EA, et al. Clinical validation of a targeted methylation-based multi-cancer early detection test using an independent validation set.Ann. Oncol.2021.PubMed。Schrag D, et al. Blood-based tests for multicancer early detection (PATHFINDER): a prospective cohort study.Lancet. 2023. PMC全文。Nabavizadeh等. Performance and safety of a multi-cancer early detection test: the PATHFINDER 2 study.Nat. Med.2026.。图11使用其Fig. 2CC BY 4.0。Tie J, et al. Circulating Tumor DNA Analysis Guiding Adjuvant Therapy in Stage II Colon Cancer.N. Engl. J. Med.2022.。5年随访。美国FDA. 已获批伴随诊断清单Guardant360 CDx监管说明。cfDNA检测的技术限制综述汗液作为诊断体液的综述乳腺癌汗液挥发物初步研究。