首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >GLOBOCAN 数据库拆给你看:185 国 36 瘤种怎么发论文,以及 GBD 包如何把它一键转成 GBD 格式

GLOBOCAN 数据库拆给你看:185 国 36 瘤种怎么发论文,以及 GBD 包如何把它一键转成 GBD 格式

原创
作者头像
用户7200114
发布2026-08-11 18:54:40
发布2026-08-11 18:54:40
1500
举报

GLOBOCAN 数据库拆给你看:185 国 36 瘤种怎么发论文,以及 GBD 包如何把它一键转成 GBD 格式

上一篇我们拆了 5 篇中国团队的 GBD 肿瘤论文。评论区问得最多的一句是:"GLOBOCAN 和 GBD 到底啥关系?我下的那堆 CSV 怎么才能像 GBD 数据那样跑?"

这篇一次说清:先拆 7 张真实论文里的图,看清 4 条已被验证的 GLOBOCAN 选题套路;再讲 GlobalBurdenR 包里那 4 个专门收拾 GLOBOCAN 的函数——把 IARC 官网下的原始 CSV,一路捋成和 GBD 一模一样的八列长格式。


一、先把两个库的关系摆平

很多人第一次做全球肿瘤负担,会在 GLOBOCAN 和 GBD 之间反复横跳。其实这两个库根本不冲突,它们回答的是两个不同的问题。

图说:左边 GLOBOCAN 由 IARC 出品,覆盖 185 国 × 36 瘤种,底层是各国癌症登记(CI5)的实测数据,但只有一个估计年(现在是 2022);右边 GBD 由 IHME 出品,204 国 × 1990–2021 连续 32 年,还有 DALYs 和危险因素归因,代价是大量建模插补。一句话记住:GLOBOCAN 定现况,GBD 补趋势。

💡 选库口诀:你的研究问题里如果出现"这三十年怎么变的""多少能归因于吸烟/饮酒",用 GBD;如果出现"2022 年哪个国家最重""一辈子得这个癌的概率是多少""发达和欠发达差多少",用 GLOBOCAN。

数字层面感受一下 GLOBOCAN 2022 的体量:Bray 等人 2024 年发在 CA: A Cancer Journal for Clinicians 的官方报告(PMID 38572751)给出,2022 年全球约 2000 万例新发癌症970 万例癌症死亡;肺癌以近 250 万新发(占全部癌症 12.4%)重回第一,也是死亡首位(18.7%)。这篇报告就是所有 GLOBOCAN 论文的"官方引言弹药库",写背景时几乎绕不开。


二、套路 1:现况 + 2050 预测 —— 一个瘤种撑起一篇

案例:非霍奇金淋巴瘤 2022 全球格局(PMID 42540595)

这是最典型、也最容易复刻的 GLOBOCAN 结构:先用 2022 数据描述现况,再叠一层人口学预测推到 2045/2050。因为 GLOBOCAN 只有一个年份,"预测"就成了论文增量的主要来源——而且这个预测不需要复杂时间序列模型,只需要把 2022 的年龄别率乘上联合国人口司的未来人口结构。

先看它的主图长什么样:

看图指路:先看主地图的颜色梯度——北美、澳新、西欧是最深一档(ASIR 8.0 以上),撒哈拉以南非洲和南亚是最浅一档;再看四周那 6 个放大插图(加勒比、西欧、东南亚、波利尼西亚等)。

>

拆解:这张图之所以要做放大插图,是因为 GLOBOCAN 覆盖 185 国,里面有大量面积极小的岛国(马耳他、新加坡、密克罗尼西亚……),在全球投影上根本看不见,但它们的 ASIR 往往是极值。审稿人最常提的意见之一就是"你的地图看不见小国"——插图是标准解法。

>

如何用于你的论文:换任何一个瘤种,这张图的结构可以原样复用;GlobalBurdenR 里对应的是 CancerChangeMap()world_map_region() 系列。

再看一张更细节的——同一篇论文的"区域 × 国家"两层级 ASIR/ASMR 点带图:

看图指路:三联子图 A / B / C 分别是双性 / 男性 / 女性的终生发病风险 AAPC(年均变化百分比,2003–2017)。深蓝 = 显著上升(AAPC>0, P<0.05),浅蓝 = 上升但不显著,深红 = 显著下降,浅红 = 下降不显著。

>

拆解:泰国 +4.9% / 白俄罗斯 +4.5% / 爱沙尼亚 +3.8% 三国领涨——这正是 GLOBOCAN 终生风险时间序列分析里最有价值的一手数据。而另一边 美国 -2.3% / 奥地利 -1.9% / 德国 -0.8% 三个发达国家呈显著下降趋势。同样是高 HDI 国家,亚洲发达与欧美发达的肠癌风险轨迹完全相反——这就是为什么 AAPC 三联条形图是 GLOBOCAN 终生风险论文的标配主图。

>

如何用于你的论文:换任何瘤种,先用 GLOBOCAN 的 cumulative risk 算终生风险,再做 AAPC 三联条形图,就同时回答了"现在多大风险"+"过去十年风险升还是降"两个问题。GlobalBurdenR 里对应的是 EAPC_BAR()Joinpoint_aapc(),一行调出来。

⚠️ 易踩的坑:GLOBOCAN 的国家名和 GBD 不一致(比如 <code>Bosnia Herzegovina</code> 少了 <code>and</code>、<code>Türkiye</code> 带特殊字符、法属海外领土单列),直接 merge 会丢掉一批国家还不报错。这正是后面第六节那个函数存在的理由。


三、套路 2:终生风险 —— 把 ASR 换成"一辈子"的说法

案例:185 国结直肠癌终生风险(PMID 42565540)

这条的性价比极高,但国内做的人还不多。逻辑很简单:ASR(年龄标化率,每 10 万人)是给统计学家看的,"一个人一辈子有 4.2% 的概率得结直肠癌"是给所有人看的。GLOBOCAN 天生带 cumulative risk 字段,把它做深就是一篇。

下面这张是 CRC 论文的"区域 × 国家"两层级终生发病风险分布(6 子图 A-F):

看图指路:上排 A / B / C 是双性 / 男性 / 女性的终生发病风险,下排 D / E / F 是对应的死亡终生风险。每行是一个亚区,红色菱形是该亚区平均值,细竖线是区域内每个国家。蓝色竖线是国别数值。

>

拆解:A 图双性发病终生风险,澳新、北欧、西欧、北美排第一档,平均 3% 左右;非洲亚区整体不到 1%。但 C 图女性 vs B 图男性的行序差异很有意思——女性最高的两组是澳新和北欧,男性最高是澳新和北美,这种性别差本身就是一节讨论。再对比上下两排:发病终生风险高的国家,死亡终生风险并不一定高——典型的"治疗可及性"差距。

>

如何用于你的论文:A–C 三联做发病、D–F 三联做死亡,上下并排放一段:读者一眼看到发病/死亡分布的地理错位。GlobalBurdenR 里对应的是 world_map_region() + EAPC_BAR()

肺癌是另一篇典型的终生风险论文(PMID 39602315),它做了更细的一个维度——多起始年龄的终生风险曲线:

看图指路:左图 A 是得肺癌的终生概率,右图 B 是死于肺癌的终生概率。5 条曲线分别代表起始年龄为出生 / 40 / 50 / 60 / 70 岁时算到死的累积概率。

>

拆解:5 条线之间的差距告诉你——一个人到 50 岁还没得肺癌,他一辈子的肺癌风险比"出生算"少了约 1.5 个百分点;到 70 岁还没得的,剩余风险只剩约 2%。这条曲线的临床价值就是给筛查年龄划线——如果从 40 岁起筛,成本-效益比最高。

>

如何用于你的论文:把这条曲线放进 Introduction 或者 Discussion 都有用,而且所有 GLOBOCAN 数据都自带 ASR / 累积风险字段,换瘤种就是换 cause 字符串。GlobalBurdenR 里要做这种曲线,用 cumulative_Anals() 系列函数。

再看肺癌终生风险 vs 传统 0-74 累积风险的对比:

看图指路:左图 A 横轴是传统的 0-74 累积风险,纵轴是终生风险;右图 B 是死亡风险。颜色梯度代表国家预期寿命,从 55 岁(深蓝)到 80+ 岁(深红)。

>

拆解:两个散点云都明显偏离 y=x 参考线(虚线),预期寿命越长的国家,终生风险比 0-74 累积风险高得越多——因为 0-74 这个上限忽略了 75 岁以后的新发病例。审稿人最爱问的"为什么你的指标和经典 0-74 累积风险不一样"——一张这样的散点图就能答完。

💡 一句话记住:把同一份数据的指标换掉(ASR → 终生风险 → 多起始年龄终生风险),比把瘤种换掉更容易做出新意。


四、套路 3:HDI 不平等 —— GLOBOCAN 的看家分层轴

案例:全球乳腺癌负担的社会经济不平等(PMID 42482396)

GBD 用 SDI 五档,GLOBOCAN 用 HDI 四档(低 / 中 / 高 / 极高人类发展指数)加 20 个 UN 亚区。这是两个库最容易被搞混、也最能体现"你到底熟不熟这个库"的地方。

看图指路:A 图是得乳腺癌的终生风险,B 图是死于乳腺癌的终生风险。每一行是一个亚区,绿色菱形是该亚区平均值,那些细竖线是区域内每一个国家。

>

拆解:请对比 A、B 两图的行序——A 图排第一的是澳新、西欧、北欧(发病最高),而 B 图排第一的变成了密克罗尼西亚/波利尼西亚,澳新掉到第 5。发病最高的地区,绝不是死亡最高的地区。这就是全球肿瘤负担研究里最经典、也最好写讨论的一句话:高 HDI 地区筛查普及导致检出多,低 HDI 地区治疗可及性差导致死得多。

>

如何用于你的论文:这种"A/B 双图换序对比"是零成本的亮点——你只要把两张图并排放,读者自己就看出结论了。另外注意每行的竖线离散程度:西亚、东亚的国家间差异明显大于西非,这本身又是一段讨论。

论文里还给了一个很好用的细节:AAPC 增长最快的是韩国(5.84%)日本(5.21%),而英、法、荷、德都低于 1%。东亚快速上升 + 西欧趋于平台,是写讨论时的现成对照组。


五、套路 4:跨国对比 —— GLOBOCAN 数据 + GBD 分解的最佳组合

案例:中国 vs 美国 1990-2020 癌症死亡 4 因子分解(PMID 35143424)

这一套路是真正把 GLOBOCAN 和 GBD 合起来用的范例:用 GLOBOCAN 取 2022 的死亡数据,用 GBD 2019 取 1990-2020 的时间序列,再用 Das Gupta 分解法把死亡变化拆成 4 个因子:人口老龄化、人口规模、年龄别发病率、年龄别病死率。

看图指路:3 联子图分别是双性 / 男性 / 女性,每条曲线对应一个因子。实线 = 中国,虚线 = 美国。紫色人口规模、红色人口老龄化、蓝色年龄别发病率、绿色年龄别病死率。

>

拆解:中美两国 1990-2020 的老龄化曲线(红)几乎重合——这是大势;但人口规模曲线(紫)中国明显高于美国(中国总人口基数大);病死率曲线(绿)中国是美国的近 3 倍下降幅度——意味着中国过去 30 年在癌症治疗可及性上进步显著。

>

如何用于你的论文:把 GLOBOCAN 当横断面来源、GBD 当时间序列来源,两个库互相补足,论文能写出的讨论厚度是单库的两倍。GlobalBurdenR 里对应的是 decomposition_analysis_sex()decomposition_analysis_location()

📌 套路 4 的精髓:当单一库的数据"只能描述一面"时,把两个库拼起来,就是 1+1>2 的研究增量。


六、最实际的问题:下载的 CSV 怎么变成能跑的数据

前 4 条套路你都看明白了,真正卡住多数人的其实是第一步。GLOBOCAN 官网(gco.iarc.fr)导出的数据有几个恶心的地方:

麻烦

具体表现

后果

文件散

一个瘤种 × 一个性别 × 一个指标 = 一个 CSV

30 个瘤种要开 上百个文件

信息藏在文件名里

dataset-inc-both-sexes-in-2022-colorectum.png

年份、性别、瘤种不在表内

列名不统一

有时叫 Label,有时叫 Country.label

合并时列对不上

宽格式

Number 和 ASR 是两列并排

和 GBD 的 <code>val + metric</code> 长格式根本不兼容

国名不标准

Bosnia Herzegovina、The Netherlands

和 GBD / 地图包 join 静默丢数据

GlobalBurdenR 包里有 4 个函数专门解决这 5 个麻烦,串起来就是一条完整流水线:

图说:从官网下载的一堆 CSV 进来,出去的是和 GBD 完全一致的八列长格式(location / val / metric / cause / sex / age / year / measure)。转完之后,包里那 130 多个原本为 GBD 写的函数——世界地图、EAPC、BAPC 预测、ARIMA、集中指数、前沿分析、IF25 与 IF40 系列期刊图——一行都不用改,直接拿来跑 GLOBOCAN 数据

四个函数各管一段,说人话就是:

① GLOBOCAN_data_read():整个文件夹一次读进来

指一个目录,它把符合命名规则的 CSV 全部读进来,并且自动从文件名里把 cause、sex、age、year、measure 五个字段解析成列。文件名里写 inc 的自动标成 Incidence,写 mort 的标成 Deathsboth-sexes 标成 Both。你也可以用 pattern 参数只读发病或只读死亡,或者让它返回列表而不是合并的大表。

② GLOBOCAN_rename_columns():把列名捋顺

不管原表里地区列叫 LabelCountry.label 还是 Country,统一改名成 locationSexsex 同时存在时删掉重复的那个;measure 列里各种写法(inc/i/incidencemort/mortality/d)统一成 GBD 口径的 IncidenceDeaths

③ GLOBOCAN_location_to_standard():国名对照表

这个函数内置了一份完整的 185 国映射表,把 GLOBOCAN 的写法翻译成标准名称:补全 Bosnia and Herzegovina、把法属海外领土并回法国本土、把加沙和约旦河西岸映射成巴勒斯坦。没有这一步,你的世界地图上会莫名其妙少一块,而且 R 不会给你任何警告。

④ GLOBOCAN_transform_data_to_GBD():宽转长,最后一脚

NumberASR 两列堆成 GBD 的 val + metric 结构(Number → Number,ASR → Rate),同时做一件很关键的小事:把 "All ages" 这一行的 ASR,年龄标记改成 Age-standardized——这正是 GBD 表示年龄标化率的方式。它还兼容三种情况:只有 ASR、只有 Number、两列都有;Yearyear 大小写也自动处理。

🚀 为什么这条流水线值得花十分钟搞懂

因为它把 GLOBOCAN 并入了 GBD 的生态。转格式之前,你只能对着 Excel 手动画柱状图;转完之后,包里 130+ 个 GBD 函数瞬间对 GLOBOCAN 可用——你想做的世界地图、区域点带图、终生风险曲线、HDI 散点、IF40 期刊同款配色图,都变成了一次函数调用。


七、把四条套路做成你自己的选题

最后给一张可以直接照着填的表。任选一列的"瘤种"、一行的"套路",交叉点就是一个能立项的题目

套路

核心指标

现成参照论文

还没人做透的方向

现况 + 2050 预测

ASIR / ASMR + 人口学推演

非霍奇金淋巴瘤(42540595)

胆道癌、神经内分泌瘤

终生风险

Cumulative risk(多起始年龄)

结直肠癌(42565540)

胃癌分贲门/非贲门、食管鳞癌

HDI 不平等

HDI 四档 + 20 亚区 + 集中指数

乳腺癌(42482396)

头颈部肿瘤、儿童肿瘤

跨国对比 + 4 因子分解

GLOBOCAN + GBD 拼合

中国 vs 美国(35143424)

印度 vs 巴西、东亚 4 国对比

多起始年龄曲线

终生风险按年龄分层

肺癌(39602315)

乳腺癌、甲状腺癌

📌 三条 takeaway 1. GLOBOCAN 定现况、GBD 补趋势,同一个瘤种两个库配合,讨论部分自动变厚; 2. 换指标(ASR → 终生风险 → 多起始年龄)比换瘤种更容易做出新意,且终生风险有天然的临床解释力; 3. 数据整理不是体力活,是格式问题——四个函数把 GLOBOCAN 转成 GBD 长格式后,整个 GBD 分析生态直接复用。


🎯 下一篇想看哪个?

这篇讲的是 GLOBOCAN 的"进门"与"转格式"。接下来可以拆:① 用转好的数据跑一张 IF40 同款世界地图② 终生风险曲线从零复刻③ HDI 分层 + 集中指数不平等分析全流程。 想先看哪个,评论区扣个序号;觉得有用的话,点个「在看」+ 转发给正在选题的同门,让更多人少走两周弯路。


本文涉及的真实论文(可直接检索核对)

  • PMID 38572751 — Global cancer statistics 2022: GLOBOCAN estimates of incidence and mortality worldwide for 36 cancers in 185 countries. CA Cancer J Clin, 2024.
  • PMID 42540595 — The global landscape of non-Hodgkin lymphoma incidence and mortality in 2022 and predictions to 2045.
  • PMID 42565540 — Global landscape and temporal trends in lifetime risk of colorectal cancer in 185 countries.
  • PMID 42482396 — Global patterns, temporal trends and socioeconomic inequalities in the burden of breast cancer.
  • PMID 39602315 — Global, regional, and national lifetime risk of developing and dying from lung cancer in 2022.
  • PMID 35143424 — Cancer statistics in China and United States, 2022: profiles, trends, and determinants.
  • PMID 42282122 — Global patterns of upper gastrointestinal cancer incidence by subtype and subsite.

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • GLOBOCAN 数据库拆给你看:185 国 36 瘤种怎么发论文,以及 GBD 包如何把它一键转成 GBD 格式
    • 一、先把两个库的关系摆平
    • 二、套路 1:现况 + 2050 预测 —— 一个瘤种撑起一篇
      • 案例:非霍奇金淋巴瘤 2022 全球格局(PMID 42540595)
    • 三、套路 2:终生风险 —— 把 ASR 换成"一辈子"的说法
      • 案例:185 国结直肠癌终生风险(PMID 42565540)
    • 四、套路 3:HDI 不平等 —— GLOBOCAN 的看家分层轴
      • 案例:全球乳腺癌负担的社会经济不平等(PMID 42482396)
    • 五、套路 4:跨国对比 —— GLOBOCAN 数据 + GBD 分解的最佳组合
      • 案例:中国 vs 美国 1990-2020 癌症死亡 4 因子分解(PMID 35143424)
    • 六、最实际的问题:下载的 CSV 怎么变成能跑的数据
      • ① GLOBOCAN_data_read():整个文件夹一次读进来
      • ② GLOBOCAN_rename_columns():把列名捋顺
      • ③ GLOBOCAN_location_to_standard():国名对照表
      • ④ GLOBOCAN_transform_data_to_GBD():宽转长,最后一脚
    • 七、把四条套路做成你自己的选题
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档