Research x AIReferences
参考文献与内部资料清单
这页把我们历史上围绕 Research x AI workflow 参考过的 paper、public data resource、内部报告和项目材料集中列出来。主叙事用中文,模型名、数据库名和 assay 名保留英文。
怎么在分享里用这页
开场
用 public data 组说明:AI 不是从空白开始,而是先把已有知识变成 project context。
流程图
用 Display / NGS 组说明:内部序列池进入平台之前必须 clean、dedupe、validate。
AI 作用
用 Structure / Affinity 组说明:模型不是单一分数,而是 evidence + ranking + uncertainty。
闭环
用 CAR-T / RL 组说明:wet-lab readout 才是 reward signal,目标是提升干湿实验有效比。
迁移性
用 G-protein 组说明:同一套 data → evidence → wet-lab loop 可以迁移到非抗体蛋白。
Public data / 数据源
支撑靶点依据、序列与结构召回、表位分析和竞品背景研究。
UniProt提供蛋白序列、异构体、结构域、物种和功能注释,是包膜糖蛋白规避设计与抗原序列召回的基础。
RCSB PDB提供实验解析结构,用于获取抗原或复合物结构、表位热点并复核结合界面。
AlphaFold DB在没有 PDB 结构时补充预测结构,适合先检查结构域覆盖和无序区风险。
SAbDab抗体–抗原复合物结构库,用于理解抗体–抗原对接的真实分布并建立基准。
Observed Antibody Space / OAS人源抗体序列库,可支持人源化、序列先验和克隆家族建模。
PDBBind / affinity datasets亲和力模型训练和校准的常见来源;用于理解 Boltz-2 affinity head、PRODIGY 等模型的边界。
Display / NGS / Semi-de-novo
解释为什么 NGS 序列池需要先过滤、验证并结构化,而不能直接按读段数选择。
Lu et al. 2021 — Animal Immunization, In Vitro Display, and Machine Learning for Antibody Discovery梳理动物免疫、噬菌体或酵母展示以及机器学习辅助抗体发现等方法。
Almagro et al. 2023 — Evolution of phage display libraries for therapeutic antibody discovery说明展示文库演进和淘选逻辑,对应半从头流程中的湿实验序列池来源。
Semi-de-novo validation report内部真实运行:DLL3 阳性召回验证与 BCMA 生产运行,说明已知阳性结合分子必须能够先被召回。
BCMA / DLL3 / FcRH5 NGS files实验团队提供的 amino.txt、结合实验表格和抗原序列,是本次流程演示的数据起点。
Structure / Interface AI
支撑结合界面 AI、PDB 证据资料包以及 ChimeraX / Discovery Studio 复核。
Evans et al. 2021 — AlphaFold-Multimer早期多聚体复合物预测基线;平台将其保留为辅助评分模型和连续性基准。
Abramson et al. 2024 — AlphaFold 3统一 protein / ligand / nucleic acid interaction prediction 的新范式;理解结构预测上限。
Yin & Pierce 2024 — Evaluation of AlphaFold antibody-antigen modeling总结抗体–抗原对接的失效模式和可靠性边界,提醒不要依赖单一 ipTM。
Passaro et al. 2025 — Boltz-2开放的 AF3 风格复合物预测与亲和力预测头,是平台第一阶段后的主要评分方向。
Roy Burman et al. 2024 — AlphaRED / AF + Rosetta + replica exchange说明单模型预测后仍需要混合精修和对接精修。
AntiConf 2025抗体–抗原复合物置信度评分思路,可用于未来替代单独使用 ipTM 的界面置信度层。
Affinity / Ranking / RL
支撑候选排序、湿实验反馈信号、研发闭环以及干湿实验协同效率提升。
Boltz-2 affinity head基于结构预测共享表征输出亲和力标量;短期应优先展示并完成校准。
PRODIGY — Xue et al. / Vangone & Bonvin基于接触的 ΔG / K_D 估算;与深度模型信号正交,适合作为交叉核验。
AlphaBind — Vasquez et al. 2024 / 2025抗体亲和力优化模型,适用于亲和力成熟和 IASO 数据微调。
GearBind — Cai et al. 2024使用几何图神经网络预测突变 ΔΔG,适合从亲本结合分子出发搜索 CDR 突变。
Gordon et al. 2024 — Generative HumanizationProduct-of-Experts + antibody language model;humanization 和多目标属性优化参考。
Amin et al. 2024 — CloneBO从 clonal family 学到 BO prior;和 wet-lab feedback / active learning 思路直接相关。
Internal closed-loop RL roadmapReward v1、score calibration、active learning、contextual bandit / RL 阶梯。
CAR-T / Wet-lab validation
支撑从 AI 候选短名单到 CAR 构建体、体外功能筛选和体内验证的完整链路。
Yu et al. 2024 — FCRL5-directed CAR-T cells exhibit antitumor activity against multiple myeloma亚鸽部分的 case anchor:新靶点 rationale → CAR design → in vitro / xenograft validation。
CT103a / 026 scFv patent lineageBCMA CAR-T 公开背景和竞品/内部对照基线;只做策略参考,不在页面暴露 operational sequence。
CT103a plasmid / CAR cassette reference内部构建体参考:信号肽–结合结构域–铰链区–跨膜区–共刺激结构域–CD3ζ,对应 CAR 构建设计页面。
BCMA BLI panel / AlphaBind fine-tune notes湿实验 K_D 回流后用于校准亲和力模型和排序规则。
Wet-lab loop docs表达、binding、杀伤、CD107a、cytokine、exhaustion、in-vivo safety 等 readout 如何回流。
G-protein / Viral envelope
支撑永坤给的 G-protein design-around 逻辑。
Spindler et al. 2025 — Discovery and Validation of Alternatives to VSV-G for Pseudotyping of Lentiviral Vectors for In Vivo替代 viral glycoprotein / pseudotyping 路线的文献锚点。
UniProt viral glycoprotein recall从 Rhabdoviridae / glycoprotein 等 query 召回候选,做 VSV-G similarity 和长度过滤。
VSV-G / Cocal-G reference sequences用于 identity、47/354 equivalent position mapping 和 design-around risk band。
PDB 5OY9 / VSV-G structure reference结构比对锚点;与 Boltz / AlphaFold 预测候选做 TM-score / RMSD 对照。
G-protein smoke report内部 smoke:候选召回、identity band、position mapping、下一轮 structure batch readiness。
共同指向
这些资料共同指向同一结论:AI 的作用不是替代湿实验,而是将公开数据、内部序列池、结构证据、候选排序和实验反馈串成研发闭环,持续提高干湿实验协同效率。