上一篇我们拆了 5 篇中国团队的 GBD 肿瘤论文。评论区问得最多的一句是:"GLOBOCAN 和 GBD 到底啥关系?我下的那堆 CSV 怎么才能像 GBD 数据那样跑?"
这篇一次说清:先拆 7 张真实论文里的图,看清 4 条已被验证的 GLOBOCAN 选题套路;再讲 GlobalBurdenR 包里那 4 个专门收拾 GLOBOCAN 的函数——把 IARC 官网下的原始 CSV,一路捋成和 GBD 一模一样的八列长格式。
很多人第一次做全球肿瘤负担,会在 GLOBOCAN 和 GBD 之间反复横跳。其实这两个库根本不冲突,它们回答的是两个不同的问题。

图说:左边 GLOBOCAN 由 IARC 出品,覆盖 185 国 × 36 瘤种,底层是各国癌症登记(CI5)的实测数据,但只有一个估计年(现在是 2022);右边 GBD 由 IHME 出品,204 国 × 1990–2021 连续 32 年,还有 DALYs 和危险因素归因,代价是大量建模插补。一句话记住:GLOBOCAN 定现况,GBD 补趋势。
💡 选库口诀:你的研究问题里如果出现"这三十年怎么变的""多少能归因于吸烟/饮酒",用 GBD;如果出现"2022 年哪个国家最重""一辈子得这个癌的概率是多少""发达和欠发达差多少",用 GLOBOCAN。
数字层面感受一下 GLOBOCAN 2022 的体量:Bray 等人 2024 年发在 CA: A Cancer Journal for Clinicians 的官方报告(PMID 38572751)给出,2022 年全球约 2000 万例新发癌症、970 万例癌症死亡;肺癌以近 250 万新发(占全部癌症 12.4%)重回第一,也是死亡首位(18.7%)。这篇报告就是所有 GLOBOCAN 论文的"官方引言弹药库",写背景时几乎绕不开。
这是最典型、也最容易复刻的 GLOBOCAN 结构:先用 2022 数据描述现况,再叠一层人口学预测推到 2045/2050。因为 GLOBOCAN 只有一个年份,"预测"就成了论文增量的主要来源——而且这个预测不需要复杂时间序列模型,只需要把 2022 的年龄别率乘上联合国人口司的未来人口结构。
先看它的主图长什么样:

看图指路:先看主地图的颜色梯度——北美、澳新、西欧是最深一档(ASIR 8.0 以上),撒哈拉以南非洲和南亚是最浅一档;再看四周那 6 个放大插图(加勒比、西欧、东南亚、波利尼西亚等)。
>
拆解:这张图之所以要做放大插图,是因为 GLOBOCAN 覆盖 185 国,里面有大量面积极小的岛国(马耳他、新加坡、密克罗尼西亚……),在全球投影上根本看不见,但它们的 ASIR 往往是极值。审稿人最常提的意见之一就是"你的地图看不见小国"——插图是标准解法。
>
如何用于你的论文:换任何一个瘤种,这张图的结构可以原样复用;GlobalBurdenR 里对应的是
CancerChangeMap()和world_map_region()系列。
再看一张更细节的——同一篇论文的"区域 × 国家"两层级 ASIR/ASMR 点带图:

看图指路:三联子图 A / B / C 分别是双性 / 男性 / 女性的终生发病风险 AAPC(年均变化百分比,2003–2017)。深蓝 = 显著上升(AAPC>0, P<0.05),浅蓝 = 上升但不显著,深红 = 显著下降,浅红 = 下降不显著。
>
拆解:泰国 +4.9% / 白俄罗斯 +4.5% / 爱沙尼亚 +3.8% 三国领涨——这正是 GLOBOCAN 终生风险时间序列分析里最有价值的一手数据。而另一边 美国 -2.3% / 奥地利 -1.9% / 德国 -0.8% 三个发达国家呈显著下降趋势。同样是高 HDI 国家,亚洲发达与欧美发达的肠癌风险轨迹完全相反——这就是为什么 AAPC 三联条形图是 GLOBOCAN 终生风险论文的标配主图。
>
如何用于你的论文:换任何瘤种,先用 GLOBOCAN 的 cumulative risk 算终生风险,再做 AAPC 三联条形图,就同时回答了"现在多大风险"+"过去十年风险升还是降"两个问题。GlobalBurdenR 里对应的是
EAPC_BAR()和Joinpoint_aapc(),一行调出来。
⚠️ 易踩的坑:GLOBOCAN 的国家名和 GBD 不一致(比如 <code>Bosnia Herzegovina</code> 少了 <code>and</code>、<code>Türkiye</code> 带特殊字符、法属海外领土单列),直接 merge 会丢掉一批国家还不报错。这正是后面第六节那个函数存在的理由。
这条的性价比极高,但国内做的人还不多。逻辑很简单:ASR(年龄标化率,每 10 万人)是给统计学家看的,"一个人一辈子有 4.2% 的概率得结直肠癌"是给所有人看的。GLOBOCAN 天生带 cumulative risk 字段,把它做深就是一篇。
下面这张是 CRC 论文的"区域 × 国家"两层级终生发病风险分布(6 子图 A-F):

看图指路:上排 A / B / C 是双性 / 男性 / 女性的终生发病风险,下排 D / E / F 是对应的死亡终生风险。每行是一个亚区,红色菱形是该亚区平均值,细竖线是区域内每个国家。蓝色竖线是国别数值。
>
拆解:A 图双性发病终生风险,澳新、北欧、西欧、北美排第一档,平均 3% 左右;非洲亚区整体不到 1%。但 C 图女性 vs B 图男性的行序差异很有意思——女性最高的两组是澳新和北欧,男性最高是澳新和北美,这种性别差本身就是一节讨论。再对比上下两排:发病终生风险高的国家,死亡终生风险并不一定高——典型的"治疗可及性"差距。
>
如何用于你的论文:A–C 三联做发病、D–F 三联做死亡,上下并排放一段:读者一眼看到发病/死亡分布的地理错位。GlobalBurdenR 里对应的是
world_map_region()+EAPC_BAR()。
肺癌是另一篇典型的终生风险论文(PMID 39602315),它做了更细的一个维度——多起始年龄的终生风险曲线:

看图指路:左图 A 是得肺癌的终生概率,右图 B 是死于肺癌的终生概率。5 条曲线分别代表起始年龄为出生 / 40 / 50 / 60 / 70 岁时算到死的累积概率。
>
拆解:5 条线之间的差距告诉你——一个人到 50 岁还没得肺癌,他一辈子的肺癌风险比"出生算"少了约 1.5 个百分点;到 70 岁还没得的,剩余风险只剩约 2%。这条曲线的临床价值就是给筛查年龄划线——如果从 40 岁起筛,成本-效益比最高。
>
如何用于你的论文:把这条曲线放进 Introduction 或者 Discussion 都有用,而且所有 GLOBOCAN 数据都自带 ASR / 累积风险字段,换瘤种就是换 cause 字符串。GlobalBurdenR 里要做这种曲线,用
cumulative_Anals()系列函数。
再看肺癌终生风险 vs 传统 0-74 累积风险的对比:

看图指路:左图 A 横轴是传统的 0-74 累积风险,纵轴是终生风险;右图 B 是死亡风险。颜色梯度代表国家预期寿命,从 55 岁(深蓝)到 80+ 岁(深红)。
>
拆解:两个散点云都明显偏离 y=x 参考线(虚线),预期寿命越长的国家,终生风险比 0-74 累积风险高得越多——因为 0-74 这个上限忽略了 75 岁以后的新发病例。审稿人最爱问的"为什么你的指标和经典 0-74 累积风险不一样"——一张这样的散点图就能答完。
💡 一句话记住:把同一份数据的指标换掉(ASR → 终生风险 → 多起始年龄终生风险),比把瘤种换掉更容易做出新意。
GBD 用 SDI 五档,GLOBOCAN 用 HDI 四档(低 / 中 / 高 / 极高人类发展指数)加 20 个 UN 亚区。这是两个库最容易被搞混、也最能体现"你到底熟不熟这个库"的地方。

看图指路:A 图是得乳腺癌的终生风险,B 图是死于乳腺癌的终生风险。每一行是一个亚区,绿色菱形是该亚区平均值,那些细竖线是区域内每一个国家。
>
拆解:请对比 A、B 两图的行序——A 图排第一的是澳新、西欧、北欧(发病最高),而 B 图排第一的变成了密克罗尼西亚/波利尼西亚,澳新掉到第 5。发病最高的地区,绝不是死亡最高的地区。这就是全球肿瘤负担研究里最经典、也最好写讨论的一句话:高 HDI 地区筛查普及导致检出多,低 HDI 地区治疗可及性差导致死得多。
>
如何用于你的论文:这种"A/B 双图换序对比"是零成本的亮点——你只要把两张图并排放,读者自己就看出结论了。另外注意每行的竖线离散程度:西亚、东亚的国家间差异明显大于西非,这本身又是一段讨论。
论文里还给了一个很好用的细节:AAPC 增长最快的是韩国(5.84%)和日本(5.21%),而英、法、荷、德都低于 1%。东亚快速上升 + 西欧趋于平台,是写讨论时的现成对照组。
这一套路是真正把 GLOBOCAN 和 GBD 合起来用的范例:用 GLOBOCAN 取 2022 的死亡数据,用 GBD 2019 取 1990-2020 的时间序列,再用 Das Gupta 分解法把死亡变化拆成 4 个因子:人口老龄化、人口规模、年龄别发病率、年龄别病死率。

看图指路:3 联子图分别是双性 / 男性 / 女性,每条曲线对应一个因子。实线 = 中国,虚线 = 美国。紫色人口规模、红色人口老龄化、蓝色年龄别发病率、绿色年龄别病死率。
>
拆解:中美两国 1990-2020 的老龄化曲线(红)几乎重合——这是大势;但人口规模曲线(紫)中国明显高于美国(中国总人口基数大);病死率曲线(绿)中国是美国的近 3 倍下降幅度——意味着中国过去 30 年在癌症治疗可及性上进步显著。
>
如何用于你的论文:把 GLOBOCAN 当横断面来源、GBD 当时间序列来源,两个库互相补足,论文能写出的讨论厚度是单库的两倍。GlobalBurdenR 里对应的是
decomposition_analysis_sex()和decomposition_analysis_location()。
📌 套路 4 的精髓:当单一库的数据"只能描述一面"时,把两个库拼起来,就是 1+1>2 的研究增量。
前 4 条套路你都看明白了,真正卡住多数人的其实是第一步。GLOBOCAN 官网(gco.iarc.fr)导出的数据有几个恶心的地方:
麻烦 | 具体表现 | 后果 |
|---|---|---|
文件散 | 一个瘤种 × 一个性别 × 一个指标 = 一个 CSV | 30 个瘤种要开 上百个文件 |
信息藏在文件名里 | dataset-inc-both-sexes-in-2022-colorectum.png | 年份、性别、瘤种不在表内 |
列名不统一 | 有时叫 Label,有时叫 Country.label | 合并时列对不上 |
宽格式 | Number 和 ASR 是两列并排 | 和 GBD 的 <code>val + metric</code> 长格式根本不兼容 |
国名不标准 | Bosnia Herzegovina、The Netherlands | 和 GBD / 地图包 join 静默丢数据 |
GlobalBurdenR 包里有 4 个函数专门解决这 5 个麻烦,串起来就是一条完整流水线:

图说:从官网下载的一堆 CSV 进来,出去的是和 GBD 完全一致的八列长格式(location / val / metric / cause / sex / age / year / measure)。转完之后,包里那 130 多个原本为 GBD 写的函数——世界地图、EAPC、BAPC 预测、ARIMA、集中指数、前沿分析、IF25 与 IF40 系列期刊图——一行都不用改,直接拿来跑 GLOBOCAN 数据。
四个函数各管一段,说人话就是:
指一个目录,它把符合命名规则的 CSV 全部读进来,并且自动从文件名里把 cause、sex、age、year、measure 五个字段解析成列。文件名里写 inc 的自动标成 Incidence,写 mort 的标成 Deaths;both-sexes 标成 Both。你也可以用 pattern 参数只读发病或只读死亡,或者让它返回列表而不是合并的大表。
不管原表里地区列叫 Label、Country.label 还是 Country,统一改名成 location;Sex 和 sex 同时存在时删掉重复的那个;measure 列里各种写法(inc/i/incidence、mort/mortality/d)统一成 GBD 口径的 Incidence 和 Deaths。
这个函数内置了一份完整的 185 国映射表,把 GLOBOCAN 的写法翻译成标准名称:补全 Bosnia and Herzegovina、把法属海外领土并回法国本土、把加沙和约旦河西岸映射成巴勒斯坦。没有这一步,你的世界地图上会莫名其妙少一块,而且 R 不会给你任何警告。
把 Number 和 ASR 两列堆成 GBD 的 val + metric 结构(Number → Number,ASR → Rate),同时做一件很关键的小事:把 "All ages" 这一行的 ASR,年龄标记改成 Age-standardized——这正是 GBD 表示年龄标化率的方式。它还兼容三种情况:只有 ASR、只有 Number、两列都有;Year 和 year 大小写也自动处理。
🚀 为什么这条流水线值得花十分钟搞懂
因为它把 GLOBOCAN 并入了 GBD 的生态。转格式之前,你只能对着 Excel 手动画柱状图;转完之后,包里 130+ 个 GBD 函数瞬间对 GLOBOCAN 可用——你想做的世界地图、区域点带图、终生风险曲线、HDI 散点、IF40 期刊同款配色图,都变成了一次函数调用。
最后给一张可以直接照着填的表。任选一列的"瘤种"、一行的"套路",交叉点就是一个能立项的题目:
套路 | 核心指标 | 现成参照论文 | 还没人做透的方向 |
|---|---|---|---|
现况 + 2050 预测 | ASIR / ASMR + 人口学推演 | 非霍奇金淋巴瘤(42540595) | 胆道癌、神经内分泌瘤 |
终生风险 | Cumulative risk(多起始年龄) | 结直肠癌(42565540) | 胃癌分贲门/非贲门、食管鳞癌 |
HDI 不平等 | HDI 四档 + 20 亚区 + 集中指数 | 乳腺癌(42482396) | 头颈部肿瘤、儿童肿瘤 |
跨国对比 + 4 因子分解 | GLOBOCAN + GBD 拼合 | 中国 vs 美国(35143424) | 印度 vs 巴西、东亚 4 国对比 |
多起始年龄曲线 | 终生风险按年龄分层 | 肺癌(39602315) | 乳腺癌、甲状腺癌 |
📌 三条 takeaway 1. GLOBOCAN 定现况、GBD 补趋势,同一个瘤种两个库配合,讨论部分自动变厚; 2. 换指标(ASR → 终生风险 → 多起始年龄)比换瘤种更容易做出新意,且终生风险有天然的临床解释力; 3. 数据整理不是体力活,是格式问题——四个函数把 GLOBOCAN 转成 GBD 长格式后,整个 GBD 分析生态直接复用。
🎯 下一篇想看哪个?
这篇讲的是 GLOBOCAN 的"进门"与"转格式"。接下来可以拆:① 用转好的数据跑一张 IF40 同款世界地图;② 终生风险曲线从零复刻;③ HDI 分层 + 集中指数不平等分析全流程。 想先看哪个,评论区扣个序号;觉得有用的话,点个「在看」+ 转发给正在选题的同门,让更多人少走两周弯路。
本文涉及的真实论文(可直接检索核对)
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。