摘要: 生物学通路是由基因、蛋白质、小分子等生物分子通过物理相互作用和化学反应有序连接而成的网络,共同执行特定的细胞功能或产生特定的细胞产物。它是系统生物学研究的核心对象,旨在从整体上理解细胞的功能模块。通路具有功能性、动态性、模块化与层次性以及连通性等核心特征。主要类型包括代谢通路、信号转导通路、基因调控通路以及细胞过程通路。研究方法包括通路作图与数据库建设、通路富集分析、通路拓扑分析以及动态建模与仿真。在生物医学中,通路分析对于疾病机制阐释、药物靶点发现、多组学数据整合和生物标志物发现具有重要意义。[阅读全文]
摘要: 生物学变异是指同物种或群体内个体间在分子、细胞、生理或形态特征上的自然差异,源于遗传、环境及二者互作,是生物多样性和进化的基础。本文系统阐述了遗传变异(如SNP、插入缺失、拷贝数变异)、表观遗传变异、环境诱导变异和随机发育噪声四大来源,涵盖分子、细胞、生理和表型四个层面。其在实验设计(生物学重复的必要性)、进化适应、精准医学(药物基因组学)和农业育种中具关键意义。量化方法包括方差分析、变异系数和遗传力。前沿挑战涉及稀有变异、基因-环境互作及单细胞异质性。理解生物学变异是揭示生命规律、推动医学与农[阅读全文]
摘要: 蛋白质注释是利用实验数据、计算预测和文献知识对蛋白质的物理化学性质、结构、功能、亚细胞定位、相互作用及翻译后修饰等特征进行系统描述和分类的过程,旨在为每个蛋白质提供全面、准确且机器可读的功能档案。核心意义包括解码蛋白质组、支持功能假设、赋能组学数据分析和促进药物发现。主要注释维度涵盖基础信息与理化性质、结构与域特征、功能与活性、亚细胞定位与表达、相互作用与翻译后修饰等。关键数据库包括UniProtKB、Pfam/InterPro、PDB、STRING、KEGG/Reactome。证据等级分为实验[阅读全文]
摘要: 功能富集分析是一种生物信息学方法,用于从高通量组学数据(如基因列表)中识别在特定生物学功能类别或通路中显著富集的模式。其核心假设是:若一组基因在功能类别中非随机集中出现,则该功能与底层生物学现象密切相关。方法包括超几何检验(Fisher精确检验)、基因集富集分析(GSEA)等。分析流程包括获取目标基因列表、选择背景基因集、选取功能注释数据库、执行富集分析、多重检验校正(如FDR)及结果可视化。应用广泛,涉及转录组学、蛋白质组学、基因组学、药物研发和单细胞组学等。挑战包括背景基因集选择、多重检验校[阅读全文]
摘要: 基因功能注释是利用实验证据、计算预测和文献挖掘等方法,对基因组中特定基因或其产物的生物学功能进行描述、分类和标记的过程。其核心目标是回答“基因做什么”这一问题,并将信息结构化存储在生物数据库中。注释类型包括基于基因本体论(GO)的分子功能、生物学过程和细胞组件注释,以及通路、蛋白质结构域和表型注释。证据来源从高到低包括实验证据、计算分析、作者陈述和电子注释。主要数据库有UniProtKB、Ensembl、GO联盟、KEGG等。当前挑战包括注释不完整、偏差、上下文特异性、非编码RNA注释困难及自动[阅读全文]
摘要: GO编号(GO ID)是基因本体论(Gene Ontology)中为每个标准术语分配的唯一、稳定且持久的标识符。其格式为“GO:”加7位数字,例如GO:0008150代表“生物过程”。GO编号是连接本体、基因注释和分析工具的关键纽带,确保了基因功能描述的一致性和可追溯性。本文详细介绍了GO编号的结构、核心功能、使用方法、示例及注意事项。[阅读全文]
摘要: 有向无环图(DAG)是一种图论结构,由顶点和有向边组成,且不包含任何有向环。它天然定义了偏序关系,允许一个子节点拥有多个父节点(多继承性),比树结构更具表达能力。在生物信息学中,DAG是基因本体论(GO)的核心数据结构,用于表示术语间的“is a”和“part of”关系,支持高效的语义推理。在计算机科学中,DAG广泛应用于任务调度(拓扑排序)、版本控制(如Git)、数据流编程和动态规划。核心算法包括线性时间内的拓扑排序、最长/最短路径求解及可达性分析。DAG因无环特性,避免了循环依赖,成为建模[阅读全文]
摘要: 生物学过程(Biological Process, BP)是基因本体论(GO)三大分支之一,描述由一系列分子事件有序组合而实现的特定生物目标或结果。它关注基因产物在细胞、组织或生物体水平上的整体功能贡献,具有目标导向性、层次时序性和多分子参与等特征。BP术语组织为有向无环图(DAG),通过“is a”和“part of”关系连接,涵盖细胞过程、代谢过程、生物调节等顶层类别。其应用包括基因功能注释、功能富集分析、通路与系统生物学建模、疾病机制阐释及跨物种比较。挑战包括过程边界模糊、上下文依赖性及结[阅读全文]
摘要: 分子功能(Molecular Function, MF)是基因本体论(GO)三大分支之一,用于描述基因产物在分子层面的具体活动或任务,如结合、催化、转运等。它独立于细胞情境,回答“基因产物在分子层面具体做什么”的问题。分子功能术语组织成有向无环图(DAG),通过“is a”关系从具体活性泛化到宽泛概念。主要顶层类别包括结合、催化活性、转运蛋白活性等。分子功能注释广泛应用于功能富集分析、酶学与代谢通路研究、药物靶点发现等领域,但也存在活性与功能区别、复合功能、活性调控、非编码RNA等挑战。[阅读全文]
摘要: 批次效应(Batch effect)是指在高通量组学实验中,由于非生物学的技术性因素(如样本制备、检测平台、操作者、环境条件等)在不同实验批次间引入的系统性变异。这种变异叠加在真实生物学信号上,可能导致数据不可重复和错误发现。批次效应具有系统性、非生物学来源、可叠加性和普遍性等特征,常见于微阵列、RNA测序、蛋白质组学和代谢组学等研究。识别方法包括主成分分析(PCA)和层次聚类热图等无监督工具,以及方差分析等有监督方法。校正策略分为实验设计阶段的预防(随机化、平衡设计、引入对照)和数据分析阶段的[阅读全文]
摘要: 细胞组件是基因本体论三大分支之一,用于描述基因产物在细胞内执行功能时的具体位置或结构环境。它涵盖从亚细胞器、大分子复合物到膜结构域、细胞骨架成分及细胞外区域等不同层次的定位信息。术语被组织成有向无环图,通过'is a'和'part of'关系连接。该本体在基因产物定位注释、功能富集分析、细胞功能研究及疾病机制探讨中具有重要应用。尽管存在动态定位、精确性不足等挑战,细胞组件本体仍是整合生物学数据、理解细胞功能的核心工具。[阅读全文]
摘要: 生物学重复(Biological replicates)指在科学实验中对来自不同生物个体的样本进行独立测量,旨在估计生物群体的自然变异,确保结果的统计可靠性和可重复性。它与技术重复(同一样本多次测量)和实验重复(重复整个实验)有本质区别。在高通量组学实验中,生物学重复是差异表达分析和统计检验的基础,能提高统计功效、区分生物与技术变异。实验设计通常要求每组至少3个重复,并需避免从同一生物个体多次取样造成的假重复。数据分析中,生物学重复信息用于方差估计、批次校正等。尽管成本较高,但足够的生物学重复是[阅读全文]
摘要: 基因本体论(Gene Ontology, GO)是一个全球广泛使用的标准化生物信息学资源与知识库,旨在统一描述任何生物体中基因及其产物(如蛋白质、非编码RNA)的功能。GO由三个独立但相互关联的本体组成:细胞组件(CC)、分子功能(MF)和生物学过程(BP)。GO术语以有向无环图(DAG)结构组织,具有标准化标识符和明确的语义关系。GO的核心应用包括基因功能注释和功能富集分析,后者通过统计检验识别在特定基因集中显著富集的功能类别。GO由基因本体论联盟维护,可通过官网及多种生物信息学工具获取。GO[阅读全文]
摘要: 差异表达分析(DEA)是基因表达分析中用于识别不同生物学条件下表达水平显著变化的基因的核心统计过程。其目标是从高通量数据(如RNA-Seq或微阵列)中区分真实生物学变异与技术噪声。分析流程包括数据预处理(标准化)、基于负二项分布等模型的统计建模、多重检验校正(如FDR控制)及结果筛选。主流工具包括DESeq2、edgeR、limma-voom等,各有特点。挑战包括生物学重复的必要性、批次效应、异方差性及低表达基因处理。下游分析涉及功能富集、聚类、网络分析等。DEA广泛应用于疾病机制研究、生物标志[阅读全文]
摘要: 基因表达分析是功能基因组学和系统生物学的核心手段,通过测量细胞或组织中基因的活性(表达水平),揭示发育、疾病、环境刺激等条件下的基因调控模式。主要技术包括转录组水平的微阵列、RNA测序和qRT-PCR,蛋白质组学质谱法,以及基因敲除等功能验证方法。RNA-Seq作为金标准,其分析流程涵盖实验设计、序列比对、定量标准化、差异表达分析及功能富集等步骤。该领域广泛应用于基础生物学、疾病标志物发现、药物开发、精准医学和农业科学。当前前沿包括单细胞RNA测序、空间转录组学、多组学整合及人工智能应用。[阅读全文]
摘要: 层次聚类分析(Hierarchical clustering analysis, HC)是一种无监督机器学习方法,通过构建嵌套的簇层次结构来揭示数据内在分组模式。主要分为凝聚式(自底向上合并)和分裂式(自顶向下分裂)两种策略,前者更为常见。算法核心包括距离矩阵计算、簇间连接准则(单连接、全连接、平均连接、沃德法)的选取,输出通常以树状图(dendrogram)可视化。该方法广泛应用于基因表达分析、系统发育学、文本聚类、市场细分和化学信息学等领域。优点在于无需预设簇数、提供层次可视化,但计算复杂度[阅读全文]
摘要: 聚类热图(Clustered heatmap)是一种结合热图与层次聚类的多变量数据可视化技术。它通过颜色矩阵直观显示数据值大小,并利用树状图对行和列重新排序,以揭示数据内部的模式、关联与结构。典型的聚类热图包含主热图、行树状图、列树状图、颜色图例及行列标签等核心组件。构建步骤包括数据矩阵输入、标准化、距离计算、层次聚类及重新排序绘图。该技术广泛应用于生物信息学(如基因表达分析)、商业智能、社交网络等领域,具有强大的模式发现能力和信息浓缩优点,但对参数选择敏感且可能丢失细节。主流实现工具包括R语言[阅读全文]
摘要: 系统发育树(Phylogenetic tree),又称进化树,是系统发育学中用于表示生物实体(如物种、基因、蛋白质等)之间进化关系的分支树状图。其核心结构包括节点(代表共同祖先或分支事件)和分支(代表进化谱系),可呈现有根或无根两种主要类型。构建方法涵盖距离法(如邻接法)、最大简约法、最大似然法和贝叶斯推断法,常用分子数据(DNA、RNA、蛋白质序列)经多序列比对后分析。系统发育树在揭示生命之树、分类学、进化过程研究、分子钟定年、病原体追踪及功能基因组学等领域有广泛应用,但也面临长枝吸引、不完全[阅读全文]
摘要: 树状图(Dendrogram)是一种用于展示层次聚类关系的树形结构图,广泛应用于统计学、生物信息学、系统发育学和数据挖掘等领域。其核心结构包括叶子节点(原始数据点)、内部节点(聚合簇)和根节点(最终聚合簇),分支长度通常表示对象间的距离或不相似度。树状图主要分为纵向和横向两种类型,可通过层次聚类分析构建,步骤包括定义距离矩阵、选择连接方法(如单连接、全连接、平均连接和沃德法)、迭代聚合和绘制图形。解读时可通过纵向阅读观察聚合过程,通过分支长度判断相似性,并通过水平切割确定簇数。树状图具有直观性强[阅读全文]
摘要: 棕榈酸(Palmitic acid),又称十六酸,是一种常见的饱和脂肪酸,分子式为C₁₆H₃₂O₂。它在室温下为白色蜡状固体,微溶于水,易溶于有机溶剂。棕榈酸广泛存在于动植物油脂中,尤其在棕榈油中含量丰富(约44%),也是人体内从头合成的最主要饱和脂肪酸。工业上通过油脂水解和分馏生产,用于食品工业(抗结剂、起泡剂)、日化工业(肥皂、表面活性剂)及化学品合成。健康方面,过量摄入可能升高低密度脂蛋白胆固醇水平,增加心血管疾病风险,但影响小于月桂酸和肉豆蔻酸。[阅读全文]