Загружаем каталог…
Загружаем каталог…
velog
Z Yuan et al, AET5: A transcriptome-guided molecular generation framework with contrastive selfsupervised learning, PLOS Computational Biology Introduction 초기 de novo molecular generation 연구 는 방대한 chemical space를 효율적으로 탐색하기 위해 시작되었다. 기존의 high-throughput screening은 비용이 높고 탐색 가능한 화학 공간이 제한적이기 때문에, VAE, GAN, RNN, graph-based model과 같은 딥러닝 기반 생성 모델이 등장하였다. 이후 Transformer와 molecular language model 이 도입되면서 MolT5, MolGPT, Chemformer와 같이 분자의 SMILES 표현이나 구조적 패턴을 학습하여 보다 효과적으로 새로운 분자를 생성하는 방향으로 발전하였다. 그러나 이러한 초기 생성 모델의 주된 목표는 화학적으로 유효한 분자를 생성 하거나 특정 physicochemical property를 만족 시키는 것이었으며, 생성된 분자가 실제 세포에서 어떤 생물학적 반응을 유도하는지는 직접적으로 고려하지 않는 경우가 많았다. 이러한 한계를 보완하기 위해 최근에는 단순한 화학적 특성을 넘어 생물학적 정보를 조건으로 사용하는 molecular generation이 연구되기 시작했다. 특히 gene expression profile 은 세포의 전체적인 상태를 나타내며, 질병 상태와 약물 처리 이후의 세포 반응을 직접적으로 연결할 수 있다는 장점이 있다. 따라서 disease-associated expression state를 정상 상태로 되돌릴 수 있는 분자를 생성한다는 관점에서 transcriptomic information은 유용한 conditioning signal 이 될 수 있다. 하지만 기존 연구에는 두 가지 중요한 문제가 남아 있다. 첫째, 많은 방법들이 여전히 chemical syntax, molecular property , 또는 기존 약물의 prioritization과 repurposing 에 집중하고 있으며, 생성 과정에서 gene regulatory response와 같은 downstream biological effect를 명시적인 생성 제약으로 충분히 활용하지 못하고 있다 . 기존의 biological modeling 역시 protein target이나 protein–ligand interaction과 같은 비교적 직접적인 분자 수준의 관계에 집중 해 왔기 때문에, 특정 분자가 세포 전체의 regulatory state를 어떻게 변화시키는지를 고려한 생성은 상대적으로 부족 하다. 즉, “어떤 target에 결합하는가”를 넘어 “세포 상태를 원하는 방향으로 변화시키는가”라는 biological-effect-oriented generation이 충분히 다뤄지지 않았다는 것이다. 둘째, 기존 expression-conditioned generation에서 gene expression을 표현하는 방법 자체에도 한계가 있다. 많은 연구가 raw expression vector를 직접 molecular representation과 concatenate하거나, linear projection을 적용하거나, VAE를 통해 저차원 latent representation으로 변환한다. 그러나 transcriptomic data는 본질적으로 high-dimensional하고 noisy하며 gene–gene dependency가 복잡 하기 때문에 단순한 linear transformation만으로는 중요한 biological pattern을 충분히 포착하기 어렵다. 또한 VAE는 smooth하고 continuous한 latent space를 만드는 데 최적화되어 있기 때문에, expression encoder로 사용할 경우 disease-specific 또는 perturbation-specific signal이 지나치게 smoothing되거나 distributional regularization에 의해 약화 될 가능성이 있다. 결과적으로 기존 embedding 방식은 gene expression이 포함하고 있는 세포 상태의 biological semantics를 충분히 보존하지 못하고, molecular generation의 biological controllability를 제한 할 수 있다. 이 문제는 질병에 따라 더욱 복잡해진다. 예를 들어 바이러스 감염은 데이터가 적고 noise가 크며 빠르게 변화하는 cellular background를 갖는 반면, cancer는 매우 높은 cellular heterogeneity와 강한 gene–gene correlation을 가진다. 따라서 서로 다른 disease context에 동일한 단순 conditioning mechanism을 적용하면 중요한 질병 특이적 biological signal을 안정적으로 추출하기 어렵다 . 결국 expression-conditioned molecular generation의 핵심 문제는 단순히 gene expression을 generator에 입력하는 것이 아니라, noise를 억제하면서도 disease와 cellular context에 관련된 정보를 보존 하고, 이를 molecular representation과 효과적으로 연결할 수 있는 transcriptomic representation을 학습 하는 것이라고 볼 수 있다. Method Transcriptome conditional encoder 다양한 교란 하에서도 일관성을 유지하는 강건한 잠재 표현을 추출하기 위해 sef-supervised contrastive learning을 통해 사전학습된다. 유전자 간의 맥락적 의존성을 명시적으로 모델링하기 위해 각 유전자를 하나의 토큰으로 간주하고, 각 샘플 내의 모든 유전자에 대해 특징별 어텐션을 적용한다. 유전자들은 의존 관계를 가지지만 본질적인 순차적 순서가 존재하지 않는다. transformer는 고차원 embedding을 입력으로 받기 때문에 scalar를 FNN으로 projection한다. 각 유전자의 두 개의 증강 뷰는 네 가지 증강 연산자, feature dropout $D$, random scaling $S$, adaptive Gaussian noise $G_{adap}$, structured Gaussian noise $G_{struct}$의 확률적 조합을 사용하여 생성된다. $$ \tilde{x}^{(i)} = A_i(x) = D_i \circ S_i \circ G_{adap,i} \circ G_{struct,i}(x) $$ 각 연산자는 다양한 교란을 생성하도록 무작위로 파라미터화되며, 연산자의 조합 순서는 특정한 모델링 의미를 갖지 않는다. feature dropout : 유전자 특징을 무작위로 마스킹 random scaling : 유전자 수준에서 발현값을 교란 adaptive Gaussian noise : 학습 세트에서 추정된 분산을 사용하여 특징별 노이즈 주입 structured Gaussian noise : 다변량 가우시안 분포 $N(0,\sum)$에서 샘플링 각 증강 뷰는 이후 유전자 수준 transformer $f_{\theta}(\cdot)$에 의해 인코딩되어 문맥화된 유전자 표현을 생성하고, projection head에 의해 샘플 수준 잠재 벡터로 압축 $$ h_1 = f_{\theta}(\tilde{x}^{(1)}), h_2 = f_{\theta}(\tilde{x}^{(2)}) $$ $$ c_1 = g(h_1), c_2 = g(h_2) $$ 모델은 InfoNCE loss를 사용하여 샘플 수준에서 최적화된다. 동일한 발현 프로파일의 두 증강 뷰는 positive pair, 동일한 배치 내 다른 샘플의 표현은 negative pair로 사용된다. $$ \mathcal{L} {InfoNCE} = -\frac{1}{B}\sum^B {i=1}log\frac{exp(\frac{sim(c^i_1,c^i_2)}{\tau})}{\sum^B_{j=1}exp(\frac{sim(c^i_1,c^i_2)}{\tau})} $$ 사전학습 이후 전사체 조건 인코더는 동결되어, 입력 약물 유도 발현 프로파일 $x$를 잠재 조건 벡터 $c = g(f_{\theta}(x))$로 매핑하는 데 사용된다. Molecule generation module Transcriptome conditional encoder가 생성한 $c$를 MolT5의 hidden state에 호환되도록 하기 위해, feed-forward condition-mapping network를 통해 고정 길이의 조건 토큰 시퀀스로 변환된다. $$ C = Reshape(FFN_{cond}(c)) \in \mathbb{R}^{K_C \times d_T} $$ $K_C$ : 조건 토큰의 수 $d_T$ : MolT5의 hidden state 생성되 조건 토큰 $C$는 MolT5 인코더의 입력으로 사용된다. 인코더에서는 self-attention을 통해 각 condition token 사이의 관계를 학습하고, 최종적으로 transcriptomic condition을 표현하는 contextualized representation $H_{enc}$를 생성한다. 이 과정을 통해 원래의 gene expression 기반 조건 정보가 MolT5가 활용할 수 있는 latent representation으로 변환된다. $$ H^l_{enc} = FFN^l_{enc}(SelfAttn(H^{l-1} {enc})) \ H^l {enc} = Adapter^l_{enc}(H^l_{enc}) $$ 반면 decoder는 이전까지 생성된 SMILES token을 입력으로 받아 다음 token을 순차적으로 예측한다. 먼저 masked self-attention을 통해 기존에 생성된 SMIELS sequence의 문맥을 반영하고, 이후 cross-attention을 통해 encoder가 생성한 transcriptomic condition representation $H_{enc}$를 참조한다. 따라서 다음 SMILES token을 결정할 때 단순히 앞선 molecular sequence만 고려하는 것이 아니라, 입력으로 주어진 biological condition도 함께 반영하게 된다. $$ H^l_{dec} = SelfAttn^l_{dec}(H^{l-1} {dec}) \ E^l = CrossAttn^l {dec}(H^l_{dec},H_{enc}) \ H^l_{dec} = Adapter^l_{dec}(FFN^l_{dec}(E^l)) $$ 이 과정에서 MolT5 전체를 처음부터 학습하지 않고, pretrained MolT5가 이미 가지고 있는 molecular language knowledge를 최대한 유지하기 위해 parameter-efficient fine-tuning 전략을 사용한다. 대부분의 pretrained parameter는 freeze하고, Transformer block 내부에 lightweight adapter를 추가하여 해당 adapter와 condition-mapping network, 그리고 일부 상위 layer만 학습한다. 이를 통해 제한된 transcriptomic-molecule pair 데이터에서도 전체 모델을 fine-tuning하는 것보다 적은 수의 parameter만 업데이트하면서 새로운 biological condition에 적응할 수 있다. 학습 단계에서는 teacher forcing을 사용한다. 즉, $n$번째 SMILES token을 예측할 때 모델이 이전에 생성한 token을 다시 입력하는 것이 아니라 실제 정답 sequence인 ($s_1,\ldots,s_{n-1}$)를 decoder의 입력으로 제공한다. 모델은 주어진 transcriptomic condition $C$와 이전 SMILES token들을 바탕으로 다음 token의 확률을 최대화하도록 학습된다. $$ -\sum_{n=1}^{N} \log p_{\psi} \left( s_n \mid s_1,\ldots,s_{n-1},C \right) $$ 추론 과정에서는 분자 다양성을 향상시키기 위해 stochastic decoding을 사용하여 전사체 조건하에서 후보 SMILES 시퀀스를 자기회귀적으로 생성한다. 결국 molecular generation module의 핵심은 transcriptome-derived embedding을 MolT5의 condition token으로 변환한 뒤, 이를 encoder에 입력하고 decoder가 cross-attention을 통해 해당 biological condition을 지속적으로 참조하면서 SMILES를 autoregressive하게 생성하는 것 Results 저자들은 실제 질병 transcriptome에서도 AET5가 작동하는지 살펴보았다. SARS-CoV-2 infection : 데이터가 제한적이고 noisy하며, 서로 다른 source에서 수집되어 heterogeneous한 transcriptome 환경 Prostate cancer(PC) : 데이터는 비교적 풍부하지만 disease mechanism이 복잡한 환경 이 실험의 목적은 크게 3개이다. noisy하고 heterogeneous한 transcriptome에서도 AET5가 안정적으로 작동하는지 모델이 학습한 disease-conditional signal이 실제 disease-related gene/target과 연결되는지 서로 다른 질환에서도 하나의 expression-conditioned generation framework가 유효한 후보 분자를 생성할 수 있는지 SARS-CoV-2 서로 다른 출처의 transcriptome을 사용하였다. 한쪽은 collective sample, 다른 쪽은 individual-level sample이었으며 두 source 사이에는 상당한 expression pattern 차이가 있었다. 저자들은 이를 그대로 하나의 조건으로 쓰기보다 mixed-sample strategy를 사용해 여러 개의 potential disease expression profile을 구성하고, 각각을 조건으로 AET5가 candidate molecule을 생성하도록 하였다. 생성된 molecule은 다음 순서로 필터링 되었다. AET5-generated molecules ↓ RDKit validity check ↓ Canonical SMILES 기반 duplicate 제거 ↓ SA score < 4인 molecule만 유지 ↓ DeepCE 기반 disease-reversal 평가 DeepCE를 통해 각 generated molecule이 유도할 것으로 예측되는 transcriptomic perturbation을 계산하고, 이를 실제 SARS-CoV-2 disease expression signature와 비교하였다. 핵심 아이디어는 다음과 같다 Disease expression Gene A ↑ Gene B ↓ Gene C ↑ Drug-induced expression Gene A ↓ Gene B ↑ Gene C ↓ 이 처럼 두 profile이 반대 방향일수록 negative correlation이 강해진다. 따라서 저자들은 disease-specific expression과 가장 강한 negative correlation을 보이는 molecule을 우선 후보로 선택했다. 선정된 후보에 대해 SwissADME, QED, BOILED-Egg 등을 사용해 drug-likeness와 pharmacokinetic property를 평가했다. 대부분의 SARS-CoV-2-conditioned molecule은: SA score < 4 QED > 0.5 BOILED-Egg의 absorbable region 또는 그 주변 에 위치했다. 또한 일부 molecule은 known compound와 TPSA–WLOGP 공간에서는 가까우면서도 구조적 유사도는 낮아, 기존 compound를 단순히 복제하지 않고 유사한 pharmacokinetic property를 가진 새로운 구조를 생성할 수 있음을 보여주었다. Prostate cancer 이전과 달리 여기서는 AET5가 molecule을 생성할 때 실제 PC-related gene signal을 참고하고 있는지를 확인하려 한다. 저자들은 molecular generator의 attention score를 이용해 각 gene locus가 token-level molecular decision에 얼마나 기여했는지 계산했다. 그 다음 attention score가 높은 gene들을 Open Targets와 비교했다. 그 결과 978개 loci 중 25개가 confidence score > 0.5인 PC-related target과 연결되었다. 이는 AET5가 transcriptome condition을 단순한 numerical control signal로 사용하는 것이 아니라, disease-relevant biological signal을 어느 정도 포착하고 있을 가능성을 보여주는 결과로 해석된다. Attention ranking 상위 50개 gene 중에서 다음 조건을 만족하는 target을 선정했다. complete protein structure가 존재 known binding pocket이 존재 reference molecule이 존재 그 결과: CHEK2 — PDB ID: 2YCF TUBB6 — PDB ID: 6AB2 가 PC-related candidate target으로 선택되었다 동시에 PC-conditioned generated molecule에 대해서도 ADME, SA, QED를 평가했다. 대부분의 molecule은 낮은 SA score 범위에 있었고, QED는 약 0.5를 중심으로 비교적 넓게 분포했다. 마지막으로 generated molecule의 target-binding potential을 평가했다. 사용한 target은 총 4개였다. Disease Target PDB ID SARS-CoV-2 Nsp3 7LMD SARS-CoV-2 RdRp 9I1S Prostate cancer CHEK2 2YCF Prostate cancer TUBB6 6AB2 SARS-CoV-2의 Nsp3와 RdRp는 각각 viral polyprotein processing/immune evasion과 viral RNA replication에 중요한 protein이다. Molecular Docking Generated molecule이 target protein의 binding pocket에 실제로 들어갈 수 있는지를 AutoDock Vina를 이용해 평가했다. 특히 SARS-CoV-2의 Nsp3 target인 7LMD에서 generated molecule은 control molecule과 유사한 binding pocket을 차지하면서도 구조적으로는 분명한 차이를 보였다. 또한 docking score 기준으로 generated molecule이 control보다 favorable한 binding profile을 보였다. Molecular dynamics simulation Docking은 정적인 binding pose만 보여주기 때문에, 저자들은 추가로 molecular dynamics simulation을 수행했다. 주요 평가 지표는: RMSD hydrogen bond number radius of gyration 이다. 7LMD에 대해 generated ligand–protein complex는 simulation 동안 비교적 안정적인 conformational behavior를 보였다. 저자들은 두 case study를 종합해 AET5가: 서로 다른 disease context에서 적용 가능하고 disease-conditioned biological signal을 반영할 가능성이 있으며 generated molecule이 favorable한 predicted pharmacokinetic property와 target-binding potential을 가질 수 있다고 주장한다 Limitations 실험적 검증 부족 현재 검증은 molecular similarity, ADME prediction, dockin
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
AET5: A transcriptome-guided molecular generation framework with contrastive selfsupervised learning. Z Yuan et al, AET5: A transcriptome-guided molecular generation framework with contrastive selfsupervised learning, PLOS Computational Biology Introduction 초기 de novo molecular generation 연구 는 방대한 chemical space를 효율적으로 탐색하기 위해 시작되었다. 기존의 high-throughput screening은 비용이 높고 탐색 가능한 화학 공간이 제한적이기 때문에,…
Открыть источник