AI 물질 생성 모델 3종(GNoME, InvDesFlow-AL, MatLLMSearch)이 제안한 결정 구조를, 생성 모델의 자체 판정과 독립적인 계산 체계(Quantum ESPRESSO / SSSP / PBE)로 재검증하는 자동화 파이프라인. 개인 워크스테이션(8코어 CPU) 수준의 자원으로 15종을 검증하고, MLIP(CHGNet)과 DFT 간 일치도(consistency)를 정량화했다.
- CHGNet–QE 일치도: Pearson r = 0.990, 안정/불안정 판정 일치 100%
- 오차의 대부분은 보정 가능한 계통 편향 (bias = -167.5 meV/atom, MAE ≈ |bias|) — 무작위 오차가 아니라 상수 보정으로 제거 가능한 성분
- 오차 크기는 결합 성격에 따라 약 50배 계층화: Intermetallic (0.4–6.7) < Pnictide (~110) < Hydride (124–347) ≈ Halide (151–370) meV/atom → 금속계는 MLIP 단독 스크리닝 가능, 이온성/수소화물은 DFT 재검증 필수 (차등 검증 전략)
- 부가 실증: LLM 생성 루프(MatLLMSearch) 직접 구동 — 구조 1종 생성, 단 검증 프로토콜 적용 범위 밖(21원자·4원소) → 생성-검증 공간 정합성 문제 발견
pipeline/ 검증 파이프라인 (validate.py: CIF → CHGNet 이완 → QE SCF → 형성 에너지)
배치 러너 3종 (체크포인팅·개별 실패 격리)
analysis/ 지표 산출 및 그림 생성 (analyze.py, plot_hierarchy.py, plot_dos.py)
MatLLMSearch 생성 구조 추출 (extract_llm.py)
results/ results.csv (15종 × 2 검증기), element_refs.json (원소 기준 캐시),
batch_status*.csv, 그림 3종 (parity / hierarchy / DOS)
qe_io/ QE 입력·출력 원본 (*.scf.in / *.scf.out — 전 계산 감사 가능) + cutoffs.json
matllmsearch/ 원본 저장소 대비 수정분 (patches.diff) + 설정 예시 (models.example.yaml)
env/ conda 환경 명세 (qe_env.yml, matllm_env.yml)
| 항목 | 설정 |
|---|---|
| DFT | Quantum ESPRESSO v7.5, PBE |
| Pseudopotentials | SSSP v2.0 Efficiency |
| Cutoff | 원소별 SSSP 권장값의 max |
| k-grid | k·L ≈ 25 Å 규칙 자동 생성 |
| Smearing | Marzari–Vanderbilt, 0.01 Ry |
| 수렴 | conv_thr 1e-7, mixing_beta 0.4 |
| MLIP | CHGNet v0.3.0, FIRE 이완 (fmax 0.05 eV/Å) |
| 원소 기준상 | MP ground state 구조를 동일 프로토콜로 자체 계산 |
| GNoME 표본 | NSites ≤ 10, 원소 2–3종, 자성 3d/f 제외, random seed 42 |
한계: 결론은 위 표본 조건 내로 한정. 무스핀·0 K 정적 DFT (영점 진동 미포함).
# 1. 환경
conda env create -f env/qe_env.yml # 검증 파이프라인용
conda env create -f env/matllm_env.yml # LLM 생성 실험용 (선택)
# 2. 의사퍼텐셜: SSSP v2.0 Efficiency (PBE)를 받아 압축 해제
# https://www.materialscloud.org/discover/sssp
# validate.py의 PSEUDO_DIR 경로를 맞춰 주세요. (원소별 컷오프는 qe_io/cutoffs.json)
# 3. 입력 데이터
# GNoME: https://github.com/google-deepmind/materials_discovery (seed 42 필터는 코드 참조)
# InvDesFlow-AL 초전도 후보: Zenodo record 14644273 (Hsupercon.zip)
# 4. 실행
conda activate qe
python pipeline/run_batch.py # GNoME 10종
python pipeline/run_batch_invdes.py # 초전도 후보 5종
python analysis/analyze.py # 지표 + parity plot
python analysis/plot_hierarchy.py # 결합 성격별 계층화원본 코드는 이 저장소에 포함하지 않는다. 원저장소를 clone한 뒤 수정분을 적용:
git clone https://github.com/JingruG/MatLLMSearch
cd MatLLMSearch
git apply /path/to/this-repo/matllmsearch/patches.diff
cp /path/to/this-repo/matllmsearch/models.example.yaml config/models.yaml
# config/credentials.yaml: api_key: ${GROQ_API_KEY} (환경변수 참조 방식 권장)
# 시드 데이터: figshare 48241624 (ppd), README의 band_gap_processed_5000.csv 링크수정분 내용: GPU 부재 환경 폴백(device 가용성 검사), provider 화이트리스트에 groq 추가(max_tokens 파라미터 분기), 로깅 비활성화 대응. 상세는 patches.diff 참조.
- Merchant et al., Scaling deep learning for materials discovery, Nature 624, 80 (2023) — GNoME
- Deng et al., Nature Machine Intelligence 5, 1031 (2023) — CHGNet
- Han et al., InvDesFlow-AL (2025) · data: Zenodo 14644273
- Gan et al., MatLLMSearch — github.com/JingruG/MatLLMSearch
- Giannozzi et al., J. Phys.: Condens. Matter 21, 395502 (2009) — Quantum ESPRESSO
- Prandini et al., npj Comput. Mater. 4, 72 (2018) — SSSP
- Jain et al., APL Materials 1, 011002 (2013) — Materials Project
- Kingsbury et al., Phys. Rev. Materials 6, 013801 (2022) — r²SCAN recomputation workflow
- Cheetham & Seshadri, Chem. Mater. 36, 3490 (2024) — critical assessment of GNoME claims
이 저장소의 모든 수치는 위 공개 데이터와 명시된 프로토콜로 제3자 재현이 가능합니다. 4-day individual project, July 2026.
