TCGA癌症名称对照表:生物信息学数据分析必备工具
1. 项目概述:为什么需要一份清晰的TCGA癌症名称对照表?
如果你正在或即将踏入癌症基因组学的研究领域,尤其是要处理TCGA(The Cancer Genome Atlas)的数据,那么你大概率会遇到一个看似简单却极其磨人的问题:这些癌症的英文全称、缩写和中文名称,怎么就对不上号呢?我刚开始接触TCGA数据时,就曾被这个问题困扰过。下载的数据集文件夹名是“BRCA”,文献里一会儿叫“Breast invasive carcinoma”,中文资料又可能写作“乳腺浸润性癌”。更头疼的是,TCGA官方项目涵盖了超过30种癌症类型,每种都有其特定的命名逻辑和简写规则,没有一个统一的“字典”,在阅读文献、撰写报告、甚至和同行交流时,都容易产生混淆和误解。
这个项目,就是基于我多年处理TCGA数据的经验,整理的一份详尽、准确、可直接查阅的TCGA癌症名称对照表。它不仅仅是一个简单的列表,更是一把帮你快速理解TCGA研究体系的钥匙。通过这份对照表,你可以:
- 高效查阅:在分析数据时,快速将文件夹缩写(如LUAD)与癌症全称(Lung adenocarcinoma)及其中文名(肺腺癌)对应起来。
- 准确沟通:在论文写作或项目讨论中,使用规范、统一的术语,避免因名称不一致导致的歧义。
- 理解分类:透过名称了解TCGA对癌症的组织学分类,例如区分“腺癌”(Adenocarcinoma)和“鳞状细胞癌”(Squamous Cell Carcinoma)。
- 快速入门:对于新手,这是梳理TCGA庞大癌症类型体系的最佳起点。
无论你是生物信息学分析师、临床科研人员,还是医学领域的学生,这份凝结了实操经验的对照表,都能成为你案头常备的实用工具,节省大量查阅和核对的时间。
2. TCGA癌症命名体系深度解析
TCGA的命名并非随意为之,其背后有一套基于医学分类学和组织病理学的严谨逻辑。理解这套逻辑,不仅能帮你记住名称,更能深化你对这些癌症本质的认识。
2.1 命名构成的三要素
一个完整的TCGA癌症类型标识,通常由三个核心要素构成,这也是我们对照表的三个核心列:
TCGA项目代码/简写 (Abbreviation):这是TCGA数据中最常用、最核心的标识符。通常是2-4个字母的缩写,用于数据集的文件夹命名、文件前缀等。例如
BRCA(乳腺癌)、LUAD(肺腺癌)。其构成规则主要有:- 器官/组织+类型:最常见的方式。如
LUAD=Lung(肺) +Adenocarcinoma(腺癌);LUSC=Lung(肺) +Squamous Cell Carcinoma(鳞状细胞癌)。 - 纯器官缩写:主要用于该器官最具代表性或唯一研究的癌种。如
GBM(Glioblastoma multiforme, 多形性胶质母细胞瘤),特指脑部的这种高度恶性胶质瘤。 - 特殊缩写:部分采用疾病英文名的首字母组合。如
AML(Acute Myeloid Leukemia, 急性髓系白血病)。
- 器官/组织+类型:最常见的方式。如
英文全称 (Full Name):指该癌症在医学文献中的标准英文名称。它精确描述了癌症的起源组织和病理学类型。例如,“Breast invasive carcinoma”强调了“浸润性”这一关键临床病理特征。全称是理解疾病本质的关键。
中文名称 (Chinese Name):对应于英文全称的规范中文医学译名。这是与国内临床医生、科研同行沟通的桥梁。翻译通常遵循“器官+病理类型”的原则,如“肺腺癌”、“肝细胞癌”。准确性至关重要,一个错误的翻译可能导致完全不同的疾病理解。
2.2 从命名看癌症分类学
TCGA的命名直接反映了癌症的分类层次,主要从两个维度:
- 解剖部位维度:即癌症发生的器官或组织。这是最顶层的分类。例如,所有
Lung(肺)开头的项目(LUAD, LUSC)都归于呼吸系统肿瘤。这能帮助我们从宏观上把握TCGA覆盖的癌种范围。 - 组织病理学维度:即癌细胞在显微镜下的形态和结构。这是区分同一器官不同癌症类型的核心。例如在肺部:
Adenocarcinoma(腺癌):癌细胞呈腺样结构,常与吸烟相关但非吸烟者也可发生,多位于肺外周。Squamous Cell Carcinoma(鳞状细胞癌):癌细胞有角化珠或细胞间桥,与吸烟关系极为密切,多位于中央气道。- 这两种类型的发病机制、驱动基因、治疗策略和预后都有显著差异。因此,TCGA将其作为两个独立项目(LUAD和LUSC)进行研究,这份对照表清晰地展示了这种重要的区分。
注意:中文命名有时会省略或简化部分病理描述词。例如“Breast invasive carcinoma”严格应译为“乳腺浸润性癌”,但国内部分语境下可能简化为“乳腺癌”。在严肃的科研写作中,建议使用完整、准确的译名。
2.3 容易混淆的命名案例与辨析
在实际使用中,有几组名称特别容易混淆,需要格外留意:
- LAML vs AML:在TCGA中,
LAML特指“Acute Myeloid Leukemia”(急性髓系白血病)。而AML这个缩写虽然在通用医学领域等同于急性髓系白血病,但在TCGA的特定上下文中,它就是LAML项目的代码。这提醒我们,在TCGA体系内,必须使用其官方项目代码。 - COAD vs READ:两者都是结直肠癌,但
COAD(Colon adenocarcinoma) 指结肠腺癌,READ(Rectum adenocarcinoma) 指直肠腺癌。虽然解剖位置毗邻,且常合称为结直肠癌(CRC),但TCGA将其分开研究,提示二者在分子特征上可能存在差异。 - KICH, KIRC, KIRP:这是一组肾脏肿瘤的经典案例,完美展示了病理分类。
KICH: Kidney Chromophobe(肾嫌色细胞癌)KIRC: Kidney renal clear cell carcinoma(肾透明细胞癌)KIRP: Kidney renal papillary cell carcinoma(肾乳头状细胞癌) 它们的缩写巧妙地包含了器官(KI)和关键病理特征(CH, RC, RP),是学习TCGA命名逻辑的绝佳范例。
理解这些命名背后的逻辑,能让你在看到缩写时,不仅仅是在查一个“代号”,而是在脑海中快速关联起其解剖位置、病理特征和临床意义。
3. 核心工具:TCGA癌症名称完整对照表
以下是我根据TCGA官方项目列表、多篇核心论文以及国内医学命名规范,反复校对整理出的对照表。表中不仅列出了三项核心信息,还补充了样本量(Cases)这一关键数据维度,并添加了简要注释,帮助你在使用时获得更多上下文信息。
| TCGA简写 | 英文全称 | 中文名称 | 样本量(约) | 注释与说明 |
|---|---|---|---|---|
| ACC | Adrenocortical carcinoma | 肾上腺皮质癌 | 90 | 罕见的内分泌系统恶性肿瘤。 |
| BLCA | Bladder Urothelial Carcinoma | 膀胱尿路上皮癌 | 430 | 最常见的膀胱癌类型,曾称移行细胞癌。 |
| BRCA | Breast invasive carcinoma | 乳腺浸润性癌 | 1100 | TCGA旗舰项目之一,包含主要分子分型(Luminal, Her2, Basal-like)。 |
| CESC | Cervical squamous cell carcinoma and endocervical adenocarcinoma | 宫颈鳞癌和宫颈腺癌 | 310 | 包含两种主要病理类型,人乳头瘤病毒(HPV)感染是主要风险因素。 |
| CHOL | Cholangiocarcinoma | 胆管癌 | 45 | 起源于胆管上皮的癌症,根据部位分肝内和肝外型。 |
| COAD | Colon adenocarcinoma | 结肠腺癌 | 460 | 常与READ合并分析为结直肠癌(CRC),但TCGA分开。 |
| DLBC | Lymphoid Neoplasm Diffuse Large B-cell Lymphoma | 弥漫性大B细胞淋巴瘤 | 50 | 最常见的非霍奇金淋巴瘤类型。 |
| ESCA | Esophageal carcinoma | 食管癌 | 200 | 主要包含食管腺癌(EAC)和食管鳞癌(ESCC),两者病因和地理分布差异大。 |
| GBM | Glioblastoma multiforme | 多形性胶质母细胞瘤 | 600 | 最常见且最具侵袭性的原发性脑肿瘤,TCGA早期重点项目。 |
| HNSC | Head and Neck squamous cell carcinoma | 头颈部鳞状细胞癌 | 530 | 包括口腔、咽、喉等部位的鳞癌,与吸烟、饮酒、HPV感染相关。 |
| KICH | Kidney Chromophobe | 肾嫌色细胞癌 | 70 | 三种主要肾细胞癌中预后最好的一种。 |
| KIRC | Kidney renal clear cell carcinoma | 肾透明细胞癌 | 540 | 最常见的肾细胞癌类型,占75%-80%。 |
| KIRP | Kidney renal papillary cell carcinoma | 肾乳头状细胞癌 | 290 | 第二种常见的肾细胞癌类型。 |
| LAML | Acute Myeloid Leukemia | 急性髓系白血病 | 200 | TCGA中血液系统肿瘤的代表,使用LAML而非通用缩写AML。 |
| LGG | Brain Lower Grade Glioma | 脑低级别胶质瘤 | 530 | 包含星形细胞瘤、少突胶质细胞瘤等,区别于高级别的GBM。 |
| LIHC | Liver hepatocellular carcinoma | 肝细胞癌 | 380 | 最常见的原发性肝癌,常与乙肝/丙肝病毒感染和肝硬化相关。 |
| LUAD | Lung adenocarcinoma | 肺腺癌 | 520 | 目前最常见的肺癌类型,非吸烟者比例相对较高。 |
| LUSC | Lung squamous cell carcinoma | 肺鳞状细胞癌 | 500 | 与吸烟高度相关,中央型肺癌多见。 |
| MESO | Mesothelioma | 间皮瘤 | 85 | 多发生于胸膜,与石棉暴露密切相关。 |
| OV | Ovarian serous cystadenocarcinoma | 卵巢浆液性囊腺癌 | 610 | 最常见的卵巢上皮性癌,高级别浆液性癌是研究重点。 |
| PAAD | Pancreatic adenocarcinoma | 胰腺腺癌 | 180 | 预后极差的“癌王”,以导管腺癌为主。 |
| PCPG | Pheochromocytoma and Paraganglioma | 嗜铬细胞瘤和副神经节瘤 | 180 | 起源于肾上腺或肾上腺外嗜铬组织的神经内分泌肿瘤。 |
| PRAD | Prostate adenocarcinoma | 前列腺腺癌 | 500 | 男性最常见的恶性肿瘤之一。 |
| READ | Rectum adenocarcinoma | 直肠腺癌 | 170 | 常与COAD合并分析为结直肠癌。 |
| SARC | Sarcoma | 肉瘤 | 260 | 来源于间叶组织(骨、软骨、脂肪、肌肉等)的恶性肿瘤,种类繁多。 |
| SKCM | Skin Cutaneous Melanoma | 皮肤黑色素瘤 | 470 | 恶性程度高的皮肤肿瘤,包含原发和转移样本。 |
| STAD | Stomach adenocarcinoma | 胃腺癌 | 440 | 胃癌的主要病理类型,与幽门螺杆菌感染等相关。 |
| TGCT | Testicular Germ Cell Tumors | 睾丸生殖细胞肿瘤 | 150 | 年轻男性常见的恶性肿瘤,治愈率高。 |
| THCA | Thyroid carcinoma | 甲状腺癌 | 510 | 以乳头状癌为主,整体预后良好。 |
| THYM | Thymoma | 胸腺瘤 | 120 | 起源于胸腺上皮的肿瘤,常伴发自身免疫性疾病。 |
| UCEC | Uterine Corpus Endometrial Carcinoma | 子宫体子宫内膜癌 | 560 | 最常见的妇科恶性肿瘤,与雌激素水平相关。 |
| UCS | Uterine Carcinosarcoma | 子宫癌肉瘤 | 55 | 罕见的高度恶性子宫肿瘤,含癌和肉瘤两种成分。 |
| UVM | Uveal Melanoma | 葡萄膜黑色素瘤 | 80 | 发生于眼睛葡萄膜的黑色素瘤,与皮肤黑色素瘤(SKCM)分子特征不同。 |
使用心得与注意事项:
- 样本量的参考价值:样本量大小直接影响后续分析(如寻找低频突变、进行亚型分型)的统计效力。对于样本量较小的癌种(如CHOL, UCS),在进行分析时需要特别注意结果的可靠性,可能需要采用不同的统计策略或与其他数据集合并。
- 版本与更新:TCGA项目本身已经结题,这份列表是其主要癌种的稳定集合。但在使用具体数据时,仍需从GDC Data Portal等官方渠道确认最新的数据版本和样本清单,因为数据清理和更新可能导致可用样本数微调。
- “混合”项目的处理:如CESC和ESCA,它们包含了不同的病理亚型。在分析时,需要留意是否需要对亚型进行区分,因为混合分析可能会掩盖亚型特异的信号。
4. 实操应用:如何在数据分析流程中高效使用对照表
整理对照表不是最终目的,将其无缝嵌入到你的数据分析工作流中,才能真正提升效率。以下是我常用的几种实战场景和方法。
4.1 场景一:数据下载与文件管理
当你从GDC Data Portal、UCSC Xena等平台下载TCGA数据时,数据通常按癌症缩写组织在文件夹中。
操作步骤:
- 使用上方的对照表,将你研究目标对应的英文全称或中文名称,转换为TCGA简写(如,研究“肺腺癌” -> 查找简写为
LUAD)。 - 在下载界面,直接选择或搜索
LUAD项目。 - 下载的数据文件可能命名为
TCGA-LUAD.htseq_counts.tsv.gz或类似格式。在本地建立项目文件夹时,我强烈建议采用项目简写_中文名的格式,例如LUAD_肺腺癌。这样在文件管理器里一目了然,避免了后续回忆“LUAD到底是哪个癌”的麻烦。
- 使用上方的对照表,将你研究目标对应的英文全称或中文名称,转换为TCGA简写(如,研究“肺腺癌” -> 查找简写为
避坑技巧:
注意:TCGA数据有不同“数据层级”(Data Level),如Level 1(原始数据)、Level 3(经过处理的基因表达/突变数据)。对于大多数生物信息学分析,我们直接从Level 3数据开始。下载时务必确认你下载的是所需的数据类型(如基因表达FPKM、体细胞突变MAF文件)和对应的层级。
4.2 场景二:分析脚本与注释文件的通用化编写
在编写数据分析脚本(如R或Python)时,硬编码癌症名称会导致脚本复用性差。利用对照表可以编写更通用的代码。
操作示例(R语言): 假设你需要为多个癌种生成表达量概览图,可以创建一个映射向量或数据框。
# 创建一个TCGA癌症信息的数据框(部分示例) tcga_cancer_info <- data.frame( Abbreviation = c("BRCA", "LUAD", "LUSC", "COAD"), Full_Name = c("Breast invasive carcinoma", "Lung adenocarcinoma", "Lung squamous cell carcinoma", "Colon adenocarcinoma"), Chinese_Name = c("乳腺浸润性癌", "肺腺癌", "肺鳞癌", "结肠腺癌"), stringsAsFactors = FALSE ) # 定义一个通用绘图函数 generate_summary_plot <- function(cancer_abbr) { # 1. 通过缩写找到中文名,用于图表标题 chinese_name <- tcga_cancer_info$Chinese_Name[tcga_cancer_info$Abbreviation == cancer_abbr] # 2. 动态构建文件路径(假设数据文件以缩写命名) data_file <- paste0("path/to/data/TCGA-", cancer_abbr, ".expression.tsv") # 3. 读取数据并分析... # df <- read.table(data_file, header=TRUE, sep="\t") # 4. 绘制图表,标题包含中文名 # p <- ggplot(...) + ggtitle(paste(chinese_name, "基因表达分布")) print(paste("正在处理:", chinese_name, "(", cancer_abbr, ")")) # 返回或保存图表 } # 批量运行 for (cancer in c("BRCA", "LUAD")) { generate_summary_plot(cancer) }这样,当你需要新增一个癌种时,只需在
tcga_cancer_info数据框和循环列表中添加对应条目即可,无需修改函数内部逻辑。
4.3 场景三:结果可视化与报告撰写
在生成分析报告、发表论文或制作演示幻灯片时,呈现规范、完整的癌症名称是专业性的体现。
最佳实践:
- 图表中:在图注或轴标签中,建议使用“英文全称(缩写)”的格式,例如 “Lung adenocarcinoma (LUAD)”。如果受众主要是中文读者,可使用“中文名(英文缩写)”,如“肺腺癌(LUAD)”。
- 正文中:首次提及某个TCGA癌种时,应给出全称并括号注明缩写,后续可使用缩写。例如:“我们分析了来自癌症基因组图谱(TCGA)的肺腺癌(Lung adenocarcinoma, LUAD)和肺鳞状细胞癌(Lung squamous cell carcinoma, LUSC)数据集。”
- 表格中:可以设立三列:“TCGA项目”、“癌症类型(英文)”、“癌症类型(中文)”,使信息一目了然。
心得分享: 我习惯在论文的“材料与方法”部分或补充材料中,以表格形式列出本研究所用的所有TCGA数据集,包含缩写、全称、样本量。这既是对照表的直接应用,也向审稿人和读者清晰展示了数据来源,增强了研究的可重复性和严谨性。
5. 常见问题与扩展资源
5.1 高频问题速查表
| 问题 | 可能原因 | 解决方案与建议 |
|---|---|---|
| 在数据库里找不到某个缩写(如“肝癌”找LIVC)? | 使用了非官方或错误的缩写。TCGA中肝癌的官方缩写是LIHC(Liver Hepatocellular Carcinoma)。 | 回顾对照表,或直接去TCGA官网/GDC门户查询官方项目列表。记忆时联系英文全称。 |
| 为什么有的癌症有多个TCGA项目(如LUAD和LUSC)? | 因为它们是同一器官(肺)下分子特征、病因和预后迥异的不同病理类型。TCGA旨在分别刻画它们的基因组图谱。 | 理解这是基于病理学的精细分类。分析时应根据研究问题决定是单独分析还是合并(如研究泛癌特征时可能合并)。 |
| 中文名称不统一,和医院病理报告上的不一样? | 医学翻译存在习惯差异,且临床病理报告可能使用更具体的亚型名称。 | 以权威教材(如《病理学》)、行业标准或大型数据库(如知网、万方收录的核心期刊常用译法)为准。对于亚型,可在括号内注明英文。 |
| 样本量为什么和我下载的实际数据量有出入? | 对照表中的样本量是TCGA项目收集的大致总数。实际下载时,可能因为部分样本数据不全、质量控制被过滤、或你只下载了特定数据类型(如只下RNA-seq),导致数量减少。 | 以你从数据平台下载后统计的实际样本数为准。对照表的样本量仅用于大致参考和比较不同癌种的规模。 |
| 想研究某个癌种,但TCGA里没有? | TCGA主要覆盖了常见癌种,并非包罗万象。一些罕见肿瘤、儿童肿瘤或特定亚型可能未被单独列项。 | 可以查看TARGET(儿童肿瘤)、GTEx(正常组织)等补充项目。或考虑使用其他独立研究队列的数据。 |
5.2 如何获取与验证最新的TCGA信息
尽管TCGA主体项目已结束,但其数据仍在被广泛使用和重分析。确保你信息的时效性和准确性很重要。
官方源头验证:
- GDC Data Portal (portal.gdc.cancer.gov):这是目前管理和提供TCGA数据的官方门户。在“Repository”页面,你可以浏览所有项目(Projects),这里列出了最权威的项目缩写和全称。
- TCGA Publications (cancergenome.nih.gov/publications):官网的出版物页面列出了所有主要的标志性论文(Cell, Nature, Cancer Cell等),每篇论文的标题和摘要都规范地使用了癌症全称和缩写,是极佳的参考。
利用成熟的生物信息学资源:
- R/Bioconductor包:如
TCGAbiolinks、curatedTCGAData。这些包的文档和函数帮助中,通常内置了准确的癌症类型映射。 - UCSC Xena Browser (xenabrowser.net):在数据集的描述中,会明确给出癌症的完整名称。
- R/Bioconductor包:如
建立个人知识库: 建议将本文的对照表保存为本地CSV文件或纳入你的笔记软件(如Notion, Obsidian)。在每次开始一个新的TCGA相关项目时,首先核对和更新这份列表,并记录下你本次分析使用的具体数据版本和样本ID列表。长此以往,你就构建起了自己专属的、带有个性化注释的TCGA元数据知识库,这将成为你科研路上的一大助力。
