Inference Providers
Active filters: ppo, trl
bnurpek/gpt2-256t-nr1wr-pos-5
Reinforcement Learning
• 0.1B • Updated • 4
bnurpek/gpt2-256t-nr1wr-pos-7
Reinforcement Learning
• 0.1B • Updated • 5
bnurpek/gpt2-256t-nr1wr-pos-10
Reinforcement Learning
• 0.1B • Updated • 6
bnurpek/gpt2-256t-nr1wr-pos-15
Reinforcement Learning
• 0.1B • Updated • 4
bnurpek/gpt2-256t-nr1wr-pos-20
Reinforcement Learning
• 0.1B • Updated • 7
bnurpek/gpt2-256t-nr1wr-pos-30
Reinforcement Learning
• 0.1B • Updated • 5
Reinforcement Learning
• Updated Reinforcement Learning
• Updated Reinforcement Learning
• Updated Reinforcement Learning
• Updated taku-yoshioka/rlhf_llm_custom_rm
Reinforcement Learning
• Updated • 1
taku-yoshioka/rlhf-line-marcja
Reinforcement Learning
• Updated • 1
Reinforcement Learning
• Updated • 1
DarshanDeshpande/gemma_2b_oasst1_ppo_model
Reinforcement Learning
• Updated • 5
MuntasirHossain/flan-t5-large-samsum-qlora-ppo
Reinforcement Learning
• Updated deepaknh/falcon7B_rlhf_v1
Reinforcement Learning
• Updated • 1
baek26/billsum_2052_bart-base
Reinforcement Learning
• 0.1B • Updated • 3
baek26/wiki_asp-animal_8989_bart-base
Reinforcement Learning
• 0.1B • Updated • 3
baek26/wiki_asp-animal_9617_bart-base
Reinforcement Learning
• 0.1B • Updated • 3
baek26/wiki_asp-educational_institution_6506_bart-base
Reinforcement Learning
• 0.1B • Updated • 2
baek26/wiki_asp-educational_institution_3034_bart-base
Reinforcement Learning
• 0.1B • Updated • 2
baek26/wiki_asp-animal_9009_bart-base
Reinforcement Learning
• 0.1B • Updated • 2
baek26/wiki_asp-software_9089_bart-base
Reinforcement Learning
• 0.1B • Updated • 2
baek26/wiki_asp-written_work_9465_bart-base
Reinforcement Learning
• 0.1B • Updated • 2
baek26/wiki_asp-software_3100_bart-base
Reinforcement Learning
• 0.1B • Updated • 3
baek26/wiki_asp-written_work_4057_bart-base
Reinforcement Learning
• 0.1B • Updated • 2
baek26/wiki_asp-software_7902_bart-base
Reinforcement Learning
• 0.1B • Updated • 3
baek26/wiki_asp-written_work_667_bart-base
Reinforcement Learning
• 0.1B • Updated • 4
baek26/wiki_asp-animal_3469_bart-base
Reinforcement Learning
• 0.1B • Updated • 2
baek26/wiki_asp-soccer_player_9782_bart-base
Reinforcement Learning
• 0.1B • Updated • 4