提交 · 5402f8e76a12789ccd2d55de40d973ed0c29e4b5 · Crayon鑫 / Paddle

27 10月, 2021 7 次提交
- X
  bugfix: only check backend when mode == Collecive (#36758) (#36772) · 5402f8e7
  由 xiongkun 提交于 10月 27, 2021
```
* bugfix: only check backend when mode == Collecive
```
  5402f8e7
- H
  Modify paddle.static.nn.cond doc (#36694) (#36767) · c542d571
  由 Huihuang Zheng 提交于 10月 27, 2021
```
Update `cond` English document
```
  c542d571
- B
  
  fim matmul dim error (#36768) · b080d986
  由 baoachun 提交于 10月 27, 2021
  
  b080d986
- H
  
  cherrypick for eigvalsh (#36680) · 9d2e0923
  由 huangjun12 提交于 10月 27, 2021
  
  9d2e0923
- W
  
  Fix inverse in fake quant (#36763) · 3fc24e09
  由 whs 提交于 10月 27, 2021
  
  3fc24e09
- G
  fix BatchNorm for fp16 (#36376) (#36691) · 417b22d2
  由 Guoxia Wang 提交于 10月 27, 2021
```
* fix BatchNorm for fp16
```
  417b22d2
- L
  Add fused attention op backward and python layer. (#36498) (#36752) · 64643d50
  由 Li Min 提交于 10月 27, 2021
```
功能：本PR的目标是提高attention模块的计算性能。
为了减少框架层对op的调度开销，本PR通过在C++层手动实现attention模块，对外提供attention 大op；
为了减少防存开销，本PR采取了两种优化方法：
（1）在q,k,v计算时通过共享输入X，将该处的gemm，transpose和bias add从三次调用减少为一次；
（2）使用kernel融合优化技术，在不同cuda kernel之间通过寄存器传输数据；
```
  64643d50
26 10月, 2021 18 次提交

W

[cherry-pick] enable trt test check and fix trt ut error（3/3） (#36696) · 211cf208
由 Wilber 提交于 10月 26, 2021

211cf208

fix wrong trt dim when input dim is 2 (#36614) (#36732) · da6e5143

由 baoachun 提交于 10月 26, 2021

* fix wrong trt dim when input dim is 2

* update leaky_relu and instance_norm converter unit test

* add instance_norm input dim check

da6e5143

[Paddle-Inference]Add MatmulV2ToMatmul convert Pass, fix (matmul_v2, matmul,... · 30ce925c

由 Wangzheee 提交于 10月 26, 2021

[Paddle-Inference]Add MatmulV2ToMatmul convert Pass, fix (matmul_v2, matmul, mul) convert pass, fix (matmul, mul) op_teller (#36652) (#36737)

30ce925c

[Cherry-pick] Add FasterTokenizer Operator (#36716) · edff5b79

由 Steffy-zxf 提交于 10月 26, 2021

* Add FasterTokenizer Operator (#34491)

Add Tokenizer related functionalities for Transformer model in order that the process of training and predicting is consistent.

* support the text string as an input Tensor
* support the "VOCAB"unordered_map<wstring, int> as an input Tensor to lookup tokens
* Tokenizer used for BERT. This tokenizer applies an end-to-end, text string to wordpiece tokenization.
* It first applies basic tokenization, followed by wordpiece tokenization.

* optimize fast tokenizer

* remove const_cast
Co-authored-by: Nzhoushunjie <zhoushunjie@baidu.com>
Co-authored-by: Nwawltor <fangzeyang0904@hotmail.com>

edff5b79

[cherry pick] add op: fused_feedforward(backward) (#36730) · 76c1bae1

由 zhangkaihuo 提交于 10月 26, 2021

* add op: fused_feedforward(backward) (#35611)

这个PR是fused_feedforward反向的代码

相关kernel实现：fused_dropout_act_bias, fused_residual_dropout_bias, fused_layernorm_residual_dropout_bias

fused_feedforward是一个融合算子，该算子对transformer模型的feed forward层的算子进行融合和封装，使得前端只呈现一个接口，通过融合减少部分访存和kernel launch的时间，以此提升性能。

* Move fused_attention and fused_feedforward functional api path to incubate (#36704)

将 #35905 和 #35843 PR中新增的的python api接口移到incubate目录下。

76c1bae1

[cherry-pick]Support FP16 in HybridParallel and Fix bugs in HybridOptimizer (#36707) · 5b357e02

由 Haohongxiang 提交于 10月 26, 2021

* fix bugs in HybridParallelClipGrad of hybrid_parallel_optimizer (#36237)

* fix bugs in HybridParallelClipGrad of hybrid_parallel_optimizer

* update

* update

* fix bugs in mp_layers、pp_layers and HybridParallelClipGrad (#36144)

* fix calling bug of HybridParallelClipGrad

* fix bugs of HybridParallelClipGrad

* add unittest of pp with HybridParallelClipGrad

* fix bugs in mp_layers.py

* update

* fix bugs in pp_layers.py

* update

* [HybridParallel]Rebuild code for pipeline (#36396)

* add no_sync for parameters sync

* add pipeline for moe

* [HybridParallel]Support fp16 in dygraph hybrid parallel (#36420)

* [HybridParallel]Support fp16 in dygraph hybrid parallel

* update

* update

* update for recompute

* add unittest of pp+fp16

* add unittest of recompute+fp16

* update

* modify ut

* modify ut of cond (#36475)

* fix bugs of ClipGradByGlobalNorm in HybridParallel (#36555)

* fix bugs of ClipGradByGlobalNorm

* add unittests

* add unittests

* [HybridParallel]fix bug of check_inf in fleet_base.py (#36651)

* fix bug of check_inf

* fix allreduce

* support ClipGradByGlobalNorm in sharding (#36012)

* support ClipGradByGlobalNorm in sharding

* support ClipGradByGlobalNorm in sharding

* test=allcase

* Update test_linalg_cond.py

* Update hybrid_parallel_util.py

* Update hybrid_parallel_util.py
Co-authored-by: NShenLiang <1422485404@qq.com>
Co-authored-by: Nzhaoyingli <86812880+zhaoyinglia@users.noreply.github.com>

5b357e02

Z
[cherry-pick]add op: fused_feedforward(forward) (#36729) · 77034fc3
由 zhangkaihuo 提交于 10月 26, 2021
```
This is a fusion operator to compute feed forward layer in transformer model architecture.
```
77034fc3
F

Pool3d 2.0 (#36545) (#36721) · dfda193f
由 feng_shuai 提交于 10月 26, 2021

dfda193f

Add bincount op (#36317) (#36709) · 610a810c

由 smallv0221 提交于 10月 26, 2021

* Add bincount op

* upload cpu version

* fix unitest

* fix unittest

* fix unittest

* fix en doc

* add more test

* fix en doc

* add more test case

* fix test

* fix input vailidation

* fix input check

* fix unittest

* fix test

* fix en doc

cherry-pick

610a810c

Y

[Cherry-pick] Add the forward QR operator (#36627) · 616ce203
由 Yulong Ao 提交于 10月 26, 2021

616ce203

Support various length support for SelectedRows in GLOO::AllGather (#36637) (#36722) · fced11bd

由 xiongkun 提交于 10月 26, 2021

Support various length support for SelectedRows in GLOO::AllGather (#36637)

    In cpu parallel using gloo, add various length support for SelectedRows

fced11bd

L
[Amp] refine code of amp level (#36362) (#36726) · 1ee4fc32
由 Leo Chen 提交于 10月 26, 2021
```
* refine amp level

* fix typo

* update tracer._amp_level
```
1ee4fc32
Y
add slot record support for GpuPS (#36723) · 53480c9c
由 yaoxuefeng 提交于 10月 26, 2021
```
* add slotrecord datafeed (#36099)

* fix multi-node (#36329)
```
53480c9c
H

cherry pick CrossEntropy's bug fix (#36647) · 32fe5a49
由 HydrogenSulfate 提交于 10月 26, 2021

32fe5a49

[cherry-pick-2.2] Fused attention op forward (#35905) (#36708) · d2be870a

由 Li Min 提交于 10月 26, 2021

功能：本PR的目标是提高attention模块的计算性能。
为了减少框架层对op的调度开销，本PR通过在C++层手动实现attention模块，对外提供attention 大op；
为了减少防存开销，本PR采取了两种优化方法：
（1）在q,k,v计算时通过共享输入X，将该处的gemm，transpose和bias add从三次调用减少为一次；
（2）使用kernel融合优化技术，在不同cuda kernel之间通过寄存器传输数据；

d2be870a

Y

add slot record dataset (#36200) (#36710) · 3fbb6644
由 yaoxuefeng 提交于 10月 26, 2021

3fbb6644

[cherry-pick] Support CPU Parallel in DataParallel Interface by GLOO to speed... · beb920cd

由 xiongkun 提交于 10月 26, 2021

[cherry-pick] Support CPU Parallel in DataParallel Interface by GLOO to speed up training (#35745) (#36605)

* User specified backend (#35745)

* remove tensordot

beb920cd

F

feat: Add TRT support for 3D(batch_norm_op and elementwise_add_op) (#36446) (#36702) · 37ac0dda
由 feng_shuai 提交于 10月 26, 2021

37ac0dda

25 10月, 2021 15 次提交
- W
  [cherry-pick 2.2] static model parallel dropout support deterministic RandomSeedGenerator (#36682) · 59615fff
  由 WangXi 提交于 10月 25, 2021
```
* Revert "Add fused_dropout wrapper to ease use. (#36185) (#36640)"

This reverts commit 05d7e2fd.

* [hybrid] seed and dropout op support force-cpu (#35820)

* [HIP] fix op not support AMD GPU bug, the flag PADDLE_WITH_ROCM is invalid

* [HIP] fix op not support AMD GPU bug, the flag PADDLE_WITH_ROCM is invalid

* [HIP] fix op not support AMD GPU bug

* [hybrid] seed and dropout op support force-cpu

* [hybrid] seed and dropout op support force-cpu

* [hybrid] seed and dropout op support force-cpu

* [hybrid] seed and dropout op support force-cpu

* [hybrid] seed and dropout op support force-cpu

* [hybrid] fix seed ci failed issue

* add AsExtra for force_cpu of seed op

* Add fused_dropout wrapper to ease use. (#36185)

* [hybrid] static model parallel dropout support deterministic RandomSeedGenerator (#36228)
Co-authored-by: Nxiayanming <41795079@qq.com>
Co-authored-by: NLi Min <11663212+limin2021@users.noreply.github.com>
```
  59615fff
- W
  [cherry-pick]Fix grid sampler (#36625) · 668db938
  由 whs 提交于 10月 25, 2021
```
* Fix grid sampler

* Fix code format
```
  668db938
- Z
  
  fix cast cuda implementation (#36679) · 4d3c7f33
  由 Zeng Jinle 提交于 10月 25, 2021
  
  4d3c7f33
- B
  
  fix interpolate mkldnn op error (#36662) · bdcc2ad4
  由 baoachun 提交于 10月 25, 2021
  
  bdcc2ad4
- B
  
  fix nullptr block in op_teller (#36622) · 5f1b193a
  由 baoachun 提交于 10月 25, 2021
  
  5f1b193a
- W
  
  [cherry-pick] enable trt test check and fix trt ut error (#36549) (#36655) · a540769b
  由 Wilber 提交于 10月 25, 2021
  
  a540769b
- W
  
  [cherry-pick] enable trt test check and fix trt ut error (#36371) (#36654) · 0951bfd1
  由 Wilber 提交于 10月 25, 2021
  
  0951bfd1
- W
  cherry-pick (#36653) · cb33835c
  由 Wilber 提交于 10月 25, 2021
```
cherry-pick prs

#36568
fix fc fuse compat problem

#36610
support lite xpu choose device id

#36010
update lite branch

#36628
add file exists check
```
  cb33835c
- J
  
  Add pool2d test convert (#36338) (#36663) · 7612bf1c
  由 JingZhuangzhuang 提交于 10月 24, 2021
  
  7612bf1c
- W
  
  Cherrypick (#36666) · a9b7d1d2
  由 wenbin 提交于 10月 25, 2021
  
  a9b7d1d2
- J
  
  CUDA sparsity support (#36413) (#36659) · 6ecfe806
  由 JingZhuangzhuang 提交于 10月 24, 2021
  
  6ecfe806
- J
  
  Fix conv2d op_teller error (#36474) (#36664) · 8ebee864
  由 JingZhuangzhuang 提交于 10月 24, 2021
  
  8ebee864
- L
  Add nn.functional.sparse_attention and some test cases, test=develop (#35757) (#36551) · c57d1e91
  由 Liu-xiandong 提交于 10月 25, 2021
```
Add paddle.nn.functional.sparse_attention API

    本个PR主要将sparse_attention功能在python层进行了一层封装，OP的主体代码见：#PR35676

    此外，对于封装的python 接口，增加了相应的单测。
```
  c57d1e91
- Z
  [Cherry Pick]Add fp16 kernel for clip_op (#36577) (#36672) · bd40dd9a
  由 zhangbo9674 提交于 10月 25, 2021
```
Add fp16 kernel for clip_op.
```
  bd40dd9a
- Z
  [Cherry Pick] refine comments for GradScaler state_dict (#36522) (#36671) · 304fb2b5
  由 zhangbo9674 提交于 10月 25, 2021
```
Refine comments for GradScaler state_dict.
```
  304fb2b5

Crayon鑫 / Paddle 与 Fork 源项目一致

Crayon鑫 / Paddle
与 Fork 源项目一致