-
Notifications
You must be signed in to change notification settings - Fork 4.4k
All issues
Issue creation is restricted in this repository
Issues
is:issue state:open
is:issue state:open
Search results
- Status: Open.#6757 In NVIDIA/Megatron-LM;
[VPP] Defer embedding initialization sync until all local model chunks are built
bugSomething isn't workingSomething isn't workingStatus: Open.#6747 In NVIDIA/Megatron-LM;- Status: Open.#6729 In NVIDIA/Megatron-LM;
- Status: Open.#6720 In NVIDIA/Megatron-LM;
Pipeline the layer-sharded Muon all_to_all to hide exchange latency (and cut peak memory)
enhancementNew feature or requestNew feature or requestStatus: Open.#6719 In NVIDIA/Megatron-LM;- Status: Open.#6714 In NVIDIA/Megatron-LM;
- Status: Open.#6708 In NVIDIA/Megatron-LM;
[RL][Performance] Avoid full-vocabulary TP gather for selected-token logprobs
enhancementNew feature or requestNew feature or requestwaiting-on-maintainersWaiting on maintainers to respondWaiting on maintainers to respondStatus: Open.#6700 In NVIDIA/Megatron-LM;Layer-sharded Muon: one Newton-Schulz home per weight over (GTP × TP)
enhancementNew feature or requestNew feature or requestStatus: Open.#6676 In NVIDIA/Megatron-LM;- Status: Open.#6656 In NVIDIA/Megatron-LM;
- Status: Open.#6653 In NVIDIA/Megatron-LM;
Extract the OpenTelemetry span-lifecycle helpers out of megatron/training/training.py
enhancementNew feature or requestNew feature or requestStatus: Open.#6631 In NVIDIA/Megatron-LM;