跳到主要内容

生命科学

185 条内容

  1. bioRxiv

    EvSpark:面向混合DNA基础模型的无损推测解码

    EvSpark 为 Evo2 这类卷积-循环-注意力混合 DNA 基础模型设计了一套推测解码系统,通过一次块前向并行验证草稿并用“状态切片”选择保留的中间状态来同时恢复 FIR、IIR 与 KV 三类推理状态而无需重放,在 Evo2 7B 的 48 条提示基准上(三个训练种子)对 43 条真实序列提示取得 2.96× 加速、含五条合成对照时为 3.27×,在 262k 上下文仍保持 1.84×–2.43×,并在 20B/40B 目标上分别取得 2.18×–2.46×(真实序列)与 2.51×–2.78×(全量套件)。
  2. medRxiv

    隐私感知蒸馏大语言模型提升多病共存评分

    该研究提出并评估了一种隐私保护的知识蒸馏框架:用CTGAN基于英国生物银行(UK Biobank)分布生成合成队列,让GPT-4o、Gemini、DeepSeek三个教师大模型在零样本设定下生成多病共存评分,再训练紧凑的学生模型CoLLM来模仿这些评分,从而在不向第三方API暴露真实患者数据的前提下,将CoLLM应用于真实UK Biobank数据(N=439,221)生成多病共存评分,并在生存预测、全基因组关联分析和多基因风险评分关联上与传统Charlson(CCI)和Elixhauser(ECI)指数比较。
  3. arXiv

    以保留率为约束的 Cellpose–SAM 训练后量化:干细胞显微成像的可审计压缩协议

    该工作提出一套预先设定保留标准的评估协议,在覆盖 BBBC038 细胞核、BBBC039 U2OS 荧光与 NIST iPSC 三种成像模态、共 176 个分层留出视野的公开面板上,检验 Cellpose–SAM 的多种训练后量化方案:仅权重量化 W8A16 在所有模态上保持实例 F1,敏感度引导的混合 W4/W8 方案(四个 INT8 例外算子)在无观测到灾难性失败的情况下把权重存储从 1162.07 MiB 降到 171.86 MiB,而三值 W2A16-G64 虽压缩到 96.21 MiB 却在 176 个视野中有 169 个灾难性失败,说明压缩应以按模态分层的下游保留率而非单一精度数字来评判。
  4. World Journal of Methodology

    前沿技术驱动的胃肠肿瘤相关骨质疏松精准管理:现状、挑战与未来展望

    这篇综述系统评估了人工智能、纳米靶向给药系统与多组学方法在胃肠肿瘤相关骨质疏松(GTO)精准管理中的方法学质量、临床有效性与转化证据,梳理了它们在AI辅助早期筛查与风险预测、纳米靶向骨保护以及基于多组学的“肿瘤—骨—肠轴”机制探索中的应用现状,并讨论了AI泛化能力有限、纳米药物安全性与生产制造难题、多维数据整合与标准化困难、多学科协作不完善及伦理关切等临床转化障碍,指出这些技术有望推动GTO管理从经验实践走向精准医学。
  5. Medinformatics

    面向EGFR抑制剂设计的生成式AI:GPT-2与LSTM模型对比

    该工作通过在约50万条来自ChEMBL数据库的分子数据上微调GPT-2模型,并与在同一数据集上训练的LSTM网络进行基准对比,生成新的EGFR抑制剂候选分子,对生成化合物进行有效性、独特性与新颖性评估,再经Lipinski五规则、合成可及性与类药性评分过滤,并对入选候选物针对EGFR(PDB ID: 1M17)开展分子对接以评估结合亲和力,结果显示GPT-2在生成结构多样分子方面表现突出,而LSTM生成的化学有效分子比例更高,许多候选物与EGFR表现出良好结合相互作用。
  6. MIT Technology Review

    AI赋能生物武器的幽灵:对生物技术界的警钟

    这篇MIT Technology Review文章梳理了AI公司领导人与研究人员对AI可能被用于设计、制造和释放生物武器的担忧,援引2022年Collaborations Pharmaceuticals用AI“分子生成器”在不到六小时内生成4万个潜在化学战剂分子的案例、Anthropic报告披露的用户试图让模型探索增强基孔肯雅病毒传播性及制造更危险禽流感等内容,同时呈现帝国理工学院部分生物学家认为AI尚不足以完整开发生物武器、当前最大疫情风险来自已在传播的病原体(如H5N1)的不同意见,并汇总了DNA订单筛查、红队/蓝队评估、AI公司调整工具等现有防护措施及其并非无懈可击的判断。
  7. Bioinformatics (Oxford, England)

    调控先验引导的注意力机制在非配对单细胞RNA-ATAC整合中保留生物结构

    该工作提出 scHPGT——一种单细胞异质先验引导 Transformer,用模态特异编码器、基于调控连接约束基因-峰注意力的先验引导跨模态 Transformer 以及域对抗目标,在共享隐空间中整合非配对 RNA 与染色质可及性图谱,并在 PBMC3k、小鼠脾脏、CITE-seq/ASAP-seq PBMC 与 PBMC10k 基准上改善聚类一致性、标签迁移与生物结构保留,同时在部分重叠与条件漂移场景中避免把未匹配或条件特异状态强行对应,且注意力导出的连接可恢复调控关系、标记基因调控区、转录因子程序与调控活性谱。
  8. bioRxiv

    OpenLipid:面向脂质组学DIA质谱数据靶向分析的大语言模型工作流

    该研究提出OpenLipid,一个基于大语言模型(LLM)的靶向DIA脂质组学工作流:它用DDA结果构建assay库,在零样本设置下直接评估DIA数据的提取离子色谱图(XIC)以挑选目标脂质峰并给出可读的判定理由,在4个人血浆与小鼠粪便正负离子模式数据集上,5% FDR下识别率与DIAMetAlyzer总体相当(血浆55.3%/19.0%、粪便71.8%/31.8%),明显高于非靶向MS-DIAL DIA(12.6%/0.0%、47.5%/0.0%),且LLM给出的色谱特征可训练分类器区分正确与错误候选峰组(交叉验证平均精度中位数0.838-0.912)。
  9. bioRxiv

    TRACEDD:面向可解释药物设计的工具锚定推理与智能体协同框架

    该工作提出 TRACEDD 框架,以“工具优先”的多智能体架构让大语言模型充当推理与编排层、由领域验证过的计算工具提供结构、化学、药理与合成预测,并以 JAK2 为案例走通从靶点验证、结构获取或 AlphaFold 预测、可成药性口袋识别、基于强化学习的从头分子生成、先导优化、ADMET 与生物活性评估、文献证据整合到逆合成规划的端到端流程,使每一步决策都与显式工具调用和中间证据相连。
  10. bioRxiv

    数据驱动的工程活体水凝胶预测性设计

    该研究利用表格基础模型TabPFN,基于一个小型活体水凝胶文库,从遗传与工艺参数预测大肠杆菌生产的含CsgA基纤维活体水凝胶的宏观材料性质,在独立验证集上对储能模量G'的预测达到R2=85.1%,相比线性回归将RMSE降低48.0%,并进一步实现按目标性质反推设计参数的性质导向设计。

第 10 页 · 当前显示 10 项