Collections
Discover the best community collections!
Collections including paper arxiv:2005.14165
-
Attention Is All You Need
Paper • 1706.03762 • Published • 140 -
PyTorch: An Imperative Style, High-Performance Deep Learning Library
Paper • 1912.01703 • Published • 2 -
google-bert/bert-base-uncased
Fill-Mask • 0.1B • Updated • 63.7M • • 2.87k -
openai-community/gpt2
Text Generation • 0.1B • Updated • 14.3M • 3.55k
-
LoRA: Low-Rank Adaptation of Large Language Models
Paper • 2106.09685 • Published • 65 -
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
Paper • 2205.14135 • Published • 16 -
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Paper • 2201.11903 • Published • 15 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 26
-
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 21 -
Evaluating Large Language Models Trained on Code
Paper • 2107.03374 • Published • 12 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 26 -
GPT-4 Technical Report
Paper • 2303.08774 • Published • 7
-
Attention Is All You Need
Paper • 1706.03762 • Published • 140 -
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 21 -
LLaMA: Open and Efficient Foundation Language Models
Paper • 2302.13971 • Published • 25 -
Llama 2: Open Foundation and Fine-Tuned Chat Models
Paper • 2307.09288 • Published • 252
-
Kimi K3: Open Frontier Intelligence
Paper • 2607.24653 • Published • 513 -
Efficient Memory Management for Large Language Model Serving with PagedAttention
Paper • 2309.06180 • Published • 69 -
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 21 -
Attention Is All You Need
Paper • 1706.03762 • Published • 140
-
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
Paper • 2602.10693 • Published • 222 -
Reinforced Attention Learning
Paper • 2602.04884 • Published • 30 -
Learning to Reason in 13 Parameters
Paper • 2602.04118 • Published • 6 -
LoRA-XS: Low-Rank Adaptation with Extremely Small Number of Parameters
Paper • 2405.17604 • Published • 4
-
deepseek-ai/DeepSeek-R1
Text Generation • 685B • Updated • 1.48M • • 13.6k -
Qwen/Qwen2.5-Coder-32B-Instruct
Text Generation • 33B • Updated • 1.72M • • 2.12k -
google/gemma-2-27b-it
Text Generation • 27B • Updated • 39.7k • • 573 -
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Paper • 2201.11903 • Published • 15
-
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 21 -
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper • 1810.04805 • Published • 33 -
Attention Is All You Need
Paper • 1706.03762 • Published • 140 -
Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation
Paper • 2510.23581 • Published • 42
-
Kimi K3: Open Frontier Intelligence
Paper • 2607.24653 • Published • 513 -
Efficient Memory Management for Large Language Model Serving with PagedAttention
Paper • 2309.06180 • Published • 69 -
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 21 -
Attention Is All You Need
Paper • 1706.03762 • Published • 140
-
Attention Is All You Need
Paper • 1706.03762 • Published • 140 -
PyTorch: An Imperative Style, High-Performance Deep Learning Library
Paper • 1912.01703 • Published • 2 -
google-bert/bert-base-uncased
Fill-Mask • 0.1B • Updated • 63.7M • • 2.87k -
openai-community/gpt2
Text Generation • 0.1B • Updated • 14.3M • 3.55k
-
LoRA: Low-Rank Adaptation of Large Language Models
Paper • 2106.09685 • Published • 65 -
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
Paper • 2205.14135 • Published • 16 -
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Paper • 2201.11903 • Published • 15 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 26
-
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
Paper • 2602.10693 • Published • 222 -
Reinforced Attention Learning
Paper • 2602.04884 • Published • 30 -
Learning to Reason in 13 Parameters
Paper • 2602.04118 • Published • 6 -
LoRA-XS: Low-Rank Adaptation with Extremely Small Number of Parameters
Paper • 2405.17604 • Published • 4
-
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 21 -
Evaluating Large Language Models Trained on Code
Paper • 2107.03374 • Published • 12 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 26 -
GPT-4 Technical Report
Paper • 2303.08774 • Published • 7
-
deepseek-ai/DeepSeek-R1
Text Generation • 685B • Updated • 1.48M • • 13.6k -
Qwen/Qwen2.5-Coder-32B-Instruct
Text Generation • 33B • Updated • 1.72M • • 2.12k -
google/gemma-2-27b-it
Text Generation • 27B • Updated • 39.7k • • 573 -
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Paper • 2201.11903 • Published • 15
-
Attention Is All You Need
Paper • 1706.03762 • Published • 140 -
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 21 -
LLaMA: Open and Efficient Foundation Language Models
Paper • 2302.13971 • Published • 25 -
Llama 2: Open Foundation and Fine-Tuned Chat Models
Paper • 2307.09288 • Published • 252
-
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 21 -
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper • 1810.04805 • Published • 33 -
Attention Is All You Need
Paper • 1706.03762 • Published • 140 -
Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation
Paper • 2510.23581 • Published • 42